En esta página
De un vistazo
- También llamado
- Contrastes múltiples, sesgo de selección, p-hacking
- 20 reglas inútiles al 5 %
- 64 % de probabilidad de que al menos una parezca significativa
- Contrastes formales
- Reality Check de White (2000), test SPA de Hansen (2005), Sharpe deflactado, PBO
- En Senzoukria
- Barrido limitado a 400 combinaciones; el DSR cuenta toda la rejilla
Por qué el mejor de muchos está inflado
Prueba una regla sin edge al nivel de significación del 5 % y hay un 5 % de probabilidad de falso positivo. Prueba veinte reglas independientes sin edge y la probabilidad de que al menos una pase es 1 − 0,95²⁰ ≈ 64 %. Las estadísticas de la regla ganadora son genuinas para esa regla sobre esos datos, pero el proceso que la encontró habría encontrado algo de todos modos. El máximo de muchos resultados ruidosos está sesgado al alza por construcción; es una propiedad de los máximos, no de los mercados.
Halbert White formalizó un contraste para esta situación en 2000, el Reality Check, que compara la mejor regla con la distribución del mejor de muchas reglas bajo la hipótesis nula de ausencia de edge. El test de capacidad predictiva superior de Peter Hansen (2005) lo refinó. El ratio de Sharpe deflactado y la probabilidad de sobreajuste del backtest abordan el mismo problema desde otros ángulos.
Los intentos que nadie cuenta
- Cambiar la ventana de sesión, el tipo de barra o el instrumento después de una primera mirada a los resultados.
- Añadir un filtro porque la curva de resultados tuvo un mal mes, y después conservarlo.
- Partir de una idea que ya funcionaba en el backtest de otra persona sobre el mismo periodo.
- Repetir un walk-forward con otro criterio de selección hasta que la eficiencia parezca aceptable.
- Cada una de estas cosas es un intento. Una corrección formal solo funciona si el recuento las incluye.
En Senzoukria
El barrido de parámetros y el walk-forward del backtest automático rechazan rejillas de más de 400 combinaciones, y el asistente de backtest tiene instrucciones de mantener los barridos por debajo de 100. El walk-forward informa de un Sharpe deflactado de sus operaciones fuera de muestra en el que el número de pruebas es el número de configuraciones entre las que eligió la selección. El Gauntlet vuelve a ejecutar toda la rejilla sobre el periodo completo, calcula el Sharpe deflactado con N igual a toda la rejilla y no a las configuraciones conservadas, estima la probabilidad de sobreajuste del backtest cuando hay al menos ocho días de sesión, y añade un contraste de permutación del ratio de Sharpe. Lo que el software no puede ver es el historial de tus ejecuciones anteriores: una rejilla lanzada tras diez rejillas abandonadas se cuenta como un solo conjunto de pruebas.
Contramedidas prácticas
- Escribe la hipótesis, la rejilla y el criterio de selección antes de mirar los resultados.
- Lleva un registro de investigación de todas las variantes probadas, incluidas las abandonadas.
- Reserva un periodo final que ninguna decisión haya tocado y úsalo una sola vez.
- Prefiere reglas cuyos vecinos en la rejilla también funcionen antes que una celda mejor aislada.
Relacionado
En la misma sección
- Sesgo de lo reciente
- Sesgo de anticipación
- Sesgo de resultado
- Selección adversa
- Seguimiento de liquidez
- Sesión de negociación
- Scripting
- Símbolo de opción OCC
Esta página en otros idiomas
Preguntas frecuentes
- ¿El data snooping es lo mismo que el sobreajuste?
- Están muy relacionados. El sobreajuste describe una regla ajustada a los accidentes de una muestra. El data snooping describe el proceso de selección: probar muchas reglas o variantes y quedarse con la mejor. El snooping es una de las principales formas de producir reglas sobreajustadas.
- ¿Un análisis walk-forward elimina el sesgo de data snooping?
- Lo reduce para los parámetros elegidos dentro del procedimiento, porque cada elección se evalúa sobre datos que no vio. No corrige las elecciones hechas fuera de él, como la familia de reglas, el instrumento o el número de walk-forwards ejecutados antes del que informas.