📜 Registro Científico y DOI Oficial: Este experimento cuenta con registro digital permanente en CERN Zenodo:
— Ver registro en Zenodo
La pregunta
¿Puede Gueta validar una población de estrategias sin sesgo de selección?
⚠️ Corrección (2026-08-16): tras una auditoría externa y verificación contra los papers originales, publicamos un addendum que corrige el modelo de ejecución (bug del loader: las señales se calcularon sobre el precio de apertura, no de cierre — pipeline internamente consistente, pero distinto al modelo pre-registrado) y la convención del PBO (el valor publicado medía la “probabilidad de pérdida” del paper, no su PBO por rango). Resultados corregidos: 13 → 8 → 7 → 0 → 0 se mantiene; PBO 0.5639 → 0.5639; sensibilidad de convenciones: 0.5551 / 0.9782 / 0.6385 — la conclusión (0 supervivientes) es invariante bajo todas las convenciones. Detalles completos: ADDENDUM-2026-08-16.
Esta es la primera publicación de Gueta Research, nuestro programa de investigación pública y reproducible. En lugar de mostrar un backtest bonito de una estrategia elegida a dedo, hicimos lo contrario: pre-registramos 13 estrategias de trading comunes, las probamos a todas con el mismo pipeline, los mismos costos y las mismas reglas, y publicamos el conteo completo en cada etapa del embudo. Si ninguna sobrevive, esa es la respuesta.
Resultado: 13 → 0. Ninguna de las 13 estrategias pasó las cuatro compuertas. Ese cero es el resultado que pre-registramos y que hoy publicamos.
Metodología (pre-registrada)
El protocolo completo quedó congelado el 15 de agosto de 2026, antes de ejecutar, en nuestro documento de pre-registro (funnel-001-pre-registration.md). Nada cambió después: ni estrategias, ni parámetros, ni umbrales. Cualquier desviación habría invalidado el estudio y tendría que publicarse como análisis aparte.
Cuatro compuertas, con umbrales fijados por la literatura académica (Bailey & López de Prado, 2014; Bailey et al., 2017):
| Compuerta | Criterio | Umbral |
|---|---|---|
| G1 IS/OOS | Retorno neto OOS @ 2 pips > 0 Y Sharpe OOS > 0 | estricto > |
| G2 WFO | Retorno neto acumulado walk-forward @ 2 pips > 0 | estricto > |
| G3 DSR | Deflated Sharpe Ratio | ≥ 0.95 |
| G4 PBO | Probabilidad de sobreajuste (CSCV) | < 0.50 |
Una estrategia solo se etiqueta “sobrevivió al embudo v1 (2026-08)” si pasa las cuatro. Nada en este proyecto se llama “validado” sin pasar el embudo completo.
Datos y ejecución
- Instrumento: EURUSD diario (OHLC), ventana completa 2020-01 → 2025-12 (1,561 barras).
- División: IS 2020-2023 (primer 50% temporal) · OOS 2024-2025 (último 50%).
- Ejecución: señales al cierre de la barra
t, ejecución al cierre de esa misma barra, posición a partir de la siguiente barra. Sin lookahead: el motor se verificó reproduciendo los resultados de la Fase A (3/3 coincidencia exacta) antes de correr el embudo. - Costos: 0 pips (control) y 2 pips por lado (spread realista EURUSD), cobrados por lado en cada cambio de posición.
Registro de pruebas: las 13 estrategias
| # | Estrategia | Regla (determinista, D1) | Parámetros |
|---|---|---|---|
| 1 | SMA Cross | Largo si SMA5 > SMA100, corto si no | 5 / 100 |
| 2 | RSI2 | Largo si RSI(15) < 2, corto si RSI(15) > 98 | 15 / 2 / 98 |
| 3 | Momentum | Largo si ROC(60) > 0, corto si ROC(60) < 0 | 60 |
| 4 | ATR Channel | Ruptura de cierre ± 1.5·ATR(14) | 14 / 1.5 |
| 5 | SuperTrend | Chande–Kroll clásico | 10 / 3 |
| 6 | Bollinger Reversion | Cierre bajo banda inferior (20, 2), salida en media | 20 / 2 |
| 7 | MACD Trader | Largo si línea MACD > señal | 12 / 26 / 9 |
| 8 | Ichimoku Cloud | Cierre sobre/bajo nube | 9 / 26 / 52 / 26 |
| 9 | EMA Cross | Largo si EMA20 > EMA50 | 20 / 50 |
| 10 | Mean Reversion (RSI) | RSI(14) < 30 / > 70, salida en 50 | 14 / 30 / 70 |
| 11 | Volume Profile proxy | Proxy POC anclado (HLC3, 20 barras) | 20 / 0.3 |
| 12 | Breakout Channel | Ruptura de máximo/mínimo de 20 | 20 |
| 13 | Range Channel | Ruptura de cierre ± 0.1·ATR(14) | 20 / 0.1 |
La familia múltiple es N = 14: incluye Donchian como hipótesis ya probada (falló la paridad MT5 con 0 operaciones; sigue contando como prueba). La familia se fijó antes de ejecutar y no admite altas ni bajas retroactivas.
Supuestos de ejecución y costos
- ATR y RSI usan suavizado Wilder (documentado; la divergencia Wilder vs SMA ya se analizó en la Fase B).
- El proxy de Volume Profile (#11) se etiqueta explícitamente como proxy: el dataset diario no tiene volumen tick. Si algún día lo hay, requiere un nuevo pre-registro, no una adaptación.
- Comisión y slippage en cero dentro del embudo: un modelo de costos más conservador solo habría reducido aún más la supervivencia.
Protocolo out-of-sample y walk-forward
- OOS: la estrategia se evalúa estrictamente sobre 2024-2025, datos jamás usados para ajustar nada (los parámetros están fijos por pre-registro).
- WFO: ventanas móviles de entrenamiento 2 años / prueba 6 meses, con los mismos parámetros pre-registrados; se reporta el retorno acumulado de las ventanas OOS.
DSR y PBO: el control del sobreajuste
Estas dos métricas son el corazón de la investigación, porque responden a la pregunta de fondo: ¿cuánta de la rentabilidad aparente es ruido? Ninguna se presenta sola: cada una va con su configuración completa, porque un número sin configuración no es evidencia.
- Deflated Sharpe Ratio (DSR) — Bailey & López de Prado (2014): infla el Sharpe observado con la penalización por probar 14 estrategias (familia N = 14, fijada antes de ejecutar). Configuración: Sharpe diario OOS @ 2 pips, corrección de curtosis (kurtosis bruta, no exceso), esperanza del mejor Sharpe bajo N=14. El mejor resultado individual (Bollinger Reversion) tuvo un DSR de 0.38, lejísimos del 0.95 exigido. Con N = 14, el mejor Sharpe esperado por pura casualidad es demasiado alto como para que cualquiera de estas reglas lo supere con significancia.
- Probability of Backtest Overfitting (PBO) — Bailey et al. (2017), CSCV con S = 16 bloques contiguos (97 barras por bloque, bloque final parcial excluido), 12,870 combinaciones exhaustivas IS/OOS, regla de selección = mejor Sharpe IS por combinación (desempate determinista). Resultado: 0.5639. Interpretación: en esta muestra, un selector que elige la mejor estrategia en el período interno tiene más de la mitad de probabilidad de perder su ventaja fuera de muestra. Es una métrica a nivel de familia (idéntica para las 13 estrategias), y cuantifica la probabilidad de que el mejor backtest esté sobreajustado — no es, por sí sola, prueba de que no exista edge: ese peso lo cargan el DSR por prueba y las compuertas G1–G3.
El embudo completo: 13 → 0
| Etapa | Criterio (definición exacta) | Sobrevivientes |
|---|---|---|
| 13 | Todas las estrategias pre-registradas, ejecutadas con parámetros fijos y el mismo pipeline | 13 |
| G1 | Retorno neto OOS @ 2 pips > 0 Y Sharpe OOS > 0 (estricto) | 8 |
| G2 | Retorno acumulado walk-forward @ 2 pips > 0 | 7 |
| G3 | DSR ≥ 0.95 (deflación con familia N = 14) | 0 |
| G4 | PBO familiar (CSCV S=16) < 0.50 | 0 |
Qué significa cada número: el 13 es el registro pre-registrado completo. El 8 son las que pasaron la prueba fuera de muestra con costos. El 7 son las que además pasaron walk-forward. El primer cero es por estrategia: ninguna resistió la deflación estadística (la mejor, Bollinger Reversion, llegó a DSR 0.382 — lejos de 0.95). El segundo cero es a nivel de familia: la probabilidad de sobreajuste del conjunto (0.5639) ya supera el umbral pre-committed, así que ninguna estrategia puede pasar G4 — el embudo termina ahí por diseño.
Las 8 que pasaron G1 (SMA Cross, Momentum, Bollinger Reversion, Ichimoku, EMA Cross, Breakout, Range, y SuperTrend solo hasta G1) mostraron retornos OOS positivos pequeños (+0.85% a +6.28% @ 2 pips), pero ninguna resistió la deflación estadística.
Por qué falló cada estrategia (tabla completa en el reporte)
| Estrategia | Params | OOS ret @ 2 pips | WFO | DSR | Falló en |
|---|---|---|---|---|---|
| RSI2 | 15/2/98 | 0.00% (0 operaciones) | 0.00% | — | G1 |
| ATR Channel | 14/1.5 | −1.90% | −10.61% | 0.030 | G1 |
| MACD Trader | 12/26/9 | −15.15% | −22.66% | 0.000 | G1 |
| Mean Reversion (RSI) | 14/30/70 | −0.10% | +10.20% | 0.042 | G1 |
| Volume Profile proxy | 20/0.3 | −8.42% | −12.31% | 0.005 | G1 |
| SuperTrend | 10/3 | +1.82% | −1.68% | 0.066 | G2 |
| SMA Cross | 5/100 | +2.66% | +17.37% | 0.077 | G3 |
| Momentum | 60 | +1.92% | +3.79% | 0.067 | G3 |
| Bollinger Reversion | 20/2 | +6.28% | +7.91% | 0.382 | G3 |
| Ichimoku Cloud | 9/26/52/26 | +2.34% | +8.17% | 0.073 | G3 |
| EMA Cross | 20/50 | +3.95% | +11.14% | 0.097 | G3 |
| Breakout Channel | 20 | +1.52% | +16.05% | 0.062 | G3 |
| Range Channel | 20/0.1 | +0.85% | +5.81% | 0.054 | G3 |
Causas: RSI2 — umbrales extremos nunca se dispararon en EURUSD diario (cero es cero: sin operaciones no hay evidencia). MACD — el peor desempeño (−15.2%, Sharpe −1.11). ATR Channel y VP proxy — negativas OOS con ambos costos. SuperTrend y MR(RSI) — positivas OOS pero walk-forward acumulado negativo. Las 7 restantes — positivas OOS y WFO, pero indistinguibles del ruido tras corregir por pruebas múltiples. La tabla completa con IS, sensibilidad a costos y estado de paridad MT5 está en funnel-001-results.md del repositorio de investigación.
Los resultados negativos son el hallazgo
Tres conclusiones, todas pre-committed y hoy publicadas. Con el alcance exacto que la evidencia permite — no más:
- 13 → 0, con alcance preciso. Dentro de esta cohorte de 13 estrategias simples pre-registradas, en este dataset (EURUSD diario 2020–2025), bajo estos supuestos de ejecución (cierre de barra, 2 pips por lado), estos escenarios de costos (0/2 pips) y este protocolo de validación (G1–G4, N=14), ninguna estrategia pasó el criterio final. Esto no es una afirmación de que “ninguna estrategia simple es rentable” — fuera de esta cohorte, este dataset o este protocolo, cualquier cosa es posible. Es una afirmación sobre este experimento, y ese es precisamente el punto: las afirmaciones requieren experimentos con esta forma.
- El spread no es el asesino principal. El promedio de retorno de las 8 ganadoras de G1 pasa de +3.1% a +2.3% al añadir 2 pips. Lo que mata es la deflación (G3) y el sobreajuste familiar (G4).
- El sesgo de selección ahora está cuantificado, no asumido. Con su configuración completa (familia N=14, S=16 bloques, 12,870 combinaciones), PBO = 0.5639 significa que los backtests individuales de estas reglas no establecen ventaja real sin corrección a nivel de familia. Si un vendedor de señales te muestra el backtest de una sola estrategia, esta investigación explica por qué eso nunca es suficiente.
En Gueta preferimos publicar un cero honesto y reproducible que un alfa imaginario. Esta es nuestra respuesta pública a la pregunta con la que empezamos.
Reproducibilidad
Limitación de datos, declarada sin esconderla: el dataset es de Yahoo Finance y no puede redistribuirse (términos del servicio). Por eso la reproducción pública funciona con un CSV suministrado por el usuario (Date,Open,High,Low,Close) verificado contra los checksums sha256 publicados. El protocolo, los umbrales, el motor y los resultados por prueba son 100% públicos; los datos no lo son. Un CSV idéntico reproduce los conteos publicados; un CSV diferente corre el mismo contrato y publica su propio resultado honesto.
- Repositorio público: github.com/guetaquant-byte/guetaquant-research — pre-registro, motor, ledger de pruebas (inmutable, tag
v1.0.0-funnel-001),REPRODUCIBILITY.md(procedimiento completo en menos de 15 minutos) yREPRODUCTION_LOG.md(pase de reproducción independiente: 0 diferencias, CSVs byte-idénticos). - Certificado de investigación:
CERTIFICATE_001.md(+ JSON) — Experiment ID | Data | Code | Protocol | Trial Family | OOS | WFO/CPCV | DSR | PBO | Costs | Execution Model | Reproduction Status. Nivel de evidencia: E3 (WFO/CPCV) + E4 (reproducción independiente); E5 (paridad de ejecución) y E6 (fidelidad en vivo) no se reclamados. - Conteo efectivo de pruebas: familia cruda N=14 (fijada), N_efectivo ≈ 3.6 (método espectral sobre correlaciones; las 13 variantes están altamente correlacionadas — máx. 0.90). La deflación DSR se aplicó con el N crudo: conservadora por diseño.
- Datos: suministrados por el usuario (Yahoo ToS); checksums en
results/funnel-001/CHECKSUMS.txt. - Sin aleatoriedad en la ejecución: el CSCV es exhaustivo (12,870 combinaciones) con desempate determinista.
- Invitación abierta: si eres quant y quieres re-correr este embudo con tus propios datos, el issue tracker del repositorio está abierto. Una reproducción independiente vale más que cualquier claim nuestro.
Preguntas frecuentes
¿Significa que el trading cuantitativo no funciona? No. Significa que estas 13 reglas simples, en este instrumento y esta ventana, no demuestran ventaja después de corregir por pruebas múltiples. La investigación no prueba que no existan estrategias con ventaja: prueba que afirmar ventaja requiere exactamente este tipo de evidencia. Ese es el estándar que queremos establecer.
¿Por qué publicar un resultado donde todo falla? Porque el resultado negativo es el resultado más informativo y el que la industria oculta. Pre-registramos 13 → 0 como desenlace válido antes de ejecutar. Ocultarlo habría sido un sesgo de publicación, que es justamente lo que este embudo combate.
¿Las tres estrategias “supervivientes” de fases anteriores siguen siendo válidas? No se etiquetan como validadas. SMA Cross, RSI2 y Momentum pasaron la paridad MT5 (Fase B), pero en este embudo v1 con umbrales fijos: RSI2 quedó con 0 operaciones, y SMA Cross y Momentum no superaron DSR. La etiqueta honesta es: probadas, no validadas.
¿Puedo reproducir el estudio con mis propios datos? Sí. El motor acepta un CSV con columnas Date, Open, High, Low, Close. Las instrucciones exactas están en el repositorio de la investigación. La reproducibilidad no depende de nuestros datos: depende del protocolo.
¿Esto es una recomendación de inversión? No. Gueta Quant es una plataforma educativa. Esta investigación es académica y demostrativa en simulación; no constituye asesoría financiera, señales operativas ni promesas de rentabilidad (Decreto 2555 de 2010).
Reproducibilidad y fuentes: protocolo pre-registrado el 2026-08-15 (docs/research_2026-08/funnel-001-pre-registration.md), resultados completos del 2026-08-16 (docs/research_2026-08/funnel-001-results.md), motor y datos de entrada documentados en el repositorio público guetaquant-byte/guetaquant-research (funnel-001/). Umbrales estadísticos según Bailey & López de Prado (2014) y Bailey et al. (2017). Los datos OHLC no se redistribuyen (términos de Yahoo Finance); el motor acepta cualquier CSV del mismo esquema.
Por