Pruebas de sobreajuste: Sharpe deflactado, PBO, permutación y estabilidad
Senzoukria mide si el resultado de un backtest sobrevive al número de configuraciones probadas: ratios de Sharpe probabilístico y deflactado, probabilidad de sobreajuste del backtest (CSCV), prueba de permutación por cambio de signo, distribución de drawdowns por barajado del orden y control de estabilidad de parámetros. Todo se calcula localmente tras un backtest automático.
Senzoukria · Documentación · Actualizado en septiembre de 2026
Dónde encontrarlo
- Dónde
- Replay → Backtest automático → resultado → bloque Gauntlet y la línea «Sharpe deflactado — probabilidad de un edge real» del walk-forward
- Referencias
- Bailey y López de Prado (2014) para el PSR/DSR; Bailey, Borwein, López de Prado y Zhu (2015) para el PBO
- Permutaciones
- 10.000 tiradas, semilla 0, deterministas
- PBO
- 16 bloques contiguos por defecto, ≥ 8 días de sesión, ≥ 2 configuraciones
A qué responde cada prueba
| Estadística | Entrada y método | Umbral |
|---|---|---|
| PSR | P&L diario de la ruta elegida; probabilidad de que el Sharpe verdadero supere 0, corregida por longitud de la muestra, asimetría y curtosis; 0 con menos de 5 observaciones | Informativo |
| DSR | La misma serie, pero la referencia es el Sharpe esperado del mejor de N configuraciones sin edge, escalado por la varianza de los Sharpe de la cuadrícula | > 0,95 para pasar (eliminatorio) |
| p-valor | P&L por operación; el signo de cada operación se invierte al azar 10.000 veces; p = (1 + recuento ≥ observado) / (1 + n) | < 0,05 para pasar (eliminatorio) |
| PBO | Matriz día de sesión × configuración; para cada partición por mitades de 16 bloques, rango fuera de muestra de la mejor configuración dentro de muestra | < 0,5 para pasar (orientativo) |
| configuraciones probadas | Número de combinaciones de la cuadrícula (N), el barrido entero, no solo las conservadas | Alimenta el DSR |
| Drawdown: el 95 % de los ordenamientos lo hacen mejor | P&L por operación barajado 10.000 veces; percentil 5 del drawdown máximo | Informativo |
| Estabilidad de parámetros | Sharpe de cuadrícula de la configuración elegida frente a las vecinas a un paso en un eje | meseta si el ratio mediano ≥ 0,7 y ninguna vecina negativa; pico si < 0,4 o hay una vecina negativa |
La línea del walk-forward
Con independencia del Gauntlet, el resultado del walk-forward lleva su propio Sharpe deflactado (lib/quant/overfit.ts), calculado sobre las operaciones fuera de muestra. Muestra el Sharpe por operación frente al umbral que produciría la propia selección, dadas las configuraciones probadas y el número de operaciones fuera de muestra, y traduce la probabilidad en una palabra: sólido a partir de 0,95, frágil entre 0,5 y 0,95, ruido por debajo de 0,5.
Las dos implementaciones difieren a propósito. La línea del walk-forward trabaja sobre rendimientos por operación y usa como dispersión la desviación típica de todos los Sharpe probados en los pliegues. El Gauntlet trabaja sobre el P&L por día de sesión y toma la dispersión de la cuadrícula de período completo. Una ejecución sin barrido tiene N = 1 y varianza cero, así que el DSR se reduce al PSR contra cero, que es lo que debe ser cuando no se ha seleccionado nada.
Cómo usarlo
- Lee primero el p-valor: si la prueba de cambio de signo no distingue el Sharpe del azar, lo demás sobra.
- Después el DSR: un Sharpe bruto alto con un DSR por debajo de 0,95 significa que el número de configuraciones explica buena parte del resultado. Estrecha el barrido o alarga el período.
- Un PBO cercano a 0,5 es azar; por encima, elegir la mejor configuración dentro de muestra perjudica activamente fuera de muestra.
- Prefiere una meseta antes que un pico en el gráfico de estabilidad: una regla que funciona alrededor de sus parámetros sobrevive a que el mercado se mueva un paso por sí solo.
Límites y trampas
Estas pruebas corrigen la selección y la no normalidad dentro de la muestra que les has dado. No ven los datos que nunca se cargaron, una estrategia editada después de un mal veredicto, ni un segundo barrido lanzado sobre las mismas barras. Cada relanzamiento es otra tirada que el contador desconoce.
Un P&L degenerado (menos de dos operaciones o desviación típica cero) devuelve un p-valor de 1 y un Sharpe de 0. Menos de cinco observaciones diarias devuelven PSR = 0. Son negativas a concluir, no medidas de una mala estrategia.
Pasar todas las pruebas es una afirmación sobre una muestra; no es una promesa de resultados en directo.
Páginas relacionadas
- Veredicto del gauntlet
- Barrido de parámetros
- Monte Carlo sobre las cuentas
- Trading cuantitativo para principiantes
- Cómo probar una estrategia de trading
Esta página en otros idiomas
Preguntas frecuentes
- ¿Por qué el PBO se muestra como «—»?
- La cuadrícula tenía una sola configuración, o había menos de 8 días de sesión disponibles para la matriz. El PBO necesita al menos dos configuraciones y suficientes bloques contiguos para partirlos por la mitad.
- ¿Por qué el DSR es más bajo que el PSR?
- El PSR se mide contra cero; el DSR se mide contra el Sharpe que alcanzaría el mejor de N configuraciones aleatorias. Con más pruebas o con una mayor dispersión de los Sharpe de la cuadrícula, esa referencia sube y el DSR baja.
- ¿Los resultados de las permutaciones son reproducibles?
- Sí. El generador es el mismo mulberry32 que usa el motor de prop firm, con semilla 0 por defecto, así que las mismas operaciones dan el mismo p-valor y los mismos percentiles en cada ejecución.