Valor p
Un valor p es la probabilidad de observar un resultado al menos tan extremo como el medido, suponiendo que la hipótesis nula es cierta. En la validación de estrategias la hipótesis nula suele ser «la regla no tiene ventaja», y el valor p sale de un procedimiento de permutación o de bootstrap sobre las operaciones registradas.
Senzoukria · Glosario · Actualizado en septiembre de 2026
Qué significa el número
Fija una hipótesis nula, por ejemplo que las operaciones de la estrategia son indistinguibles de tiradas aleatorias con la misma distribución. Calcula un estadístico sobre las operaciones reales: resultado neto, Sharpe por operación, esperanza. Después determina con qué frecuencia ese estadístico sería al menos tan grande si la hipótesis nula fuera cierta. Esa frecuencia es el valor p.
En un test de permutación la frecuencia se cuenta directamente: reordena los datos muchas veces, recalcula el estadístico y cuenta las reordenaciones que igualan o superan el real. No hace falta ninguna fórmula para la distribución, lo que importa con resultados de operaciones que rara vez son normales.
Lo que no significa
- No es la probabilidad de que la hipótesis nula sea cierta. Eso exigiría una probabilidad a priori sobre la nula, que el test no usa.
- No es la probabilidad de que la estrategia siga funcionando. Describe la muestra, no el futuro.
- No es una medida del tamaño del efecto. Una ventaja mínima sobre una muestra enorme puede dar un valor p pequeño; una ventaja grande sobre diez operaciones no puede.
- No está corregido por selección. Elige la mejor de muchas configuraciones y su valor p será optimista; el Sharpe deflactado y el PBO se ocupan de eso.
En Senzoukria
El panel de backtest de la aplicación muestra un valor p en su gauntlet de go/no-go, calculado por la fase de test de permutación. El criterio asociado se redacta como «Test de permutación: ventaja distinguible del azar». El valor p aparece junto al PSR, el DSR, el PBO y el número de configuraciones probadas, de modo que se ve de un vistazo si la muestra también sobrevive a la corrección por selección.
El panel de rendimiento de Replay no informa de ningún valor p; señala las muestras pequeñas con la nota de que los ratios se muestran porque son exactos, no porque sean significativos. Las pruebas de significación son una función del panel de backtest.
Errores frecuentes
- Quedarse en un umbral fijo. Un corte convencional es una convención, y un falso positivo se paga en una cuenta real, no en un artículo.
- Probar repetidamente sobre los mismos datos y quedarse con el valor p más pequeño. Cada prueba es un intento.
- Presentar un valor p sin el estadístico y el tamaño de muestra que lo produjeron.
- Leer un valor p grande como prueba de que no hay ventaja. Solo dice que esta muestra no la mostró.
Relacionado
- Trading cuantitativo para principiantes
- Test de permutación
- Ratio de Sharpe deflactado
- Guía de backtesting de futuros
Esta página en otros idiomas
Preguntas frecuentes
- ¿Basta un valor p pequeño para operar una estrategia?
- No. Dice que el resultado observado era raro bajo la hipótesis de no ventaja, en esa muestra y con esas hipótesis. No tiene en cuenta costes no modelados, el número de configuraciones probadas, el drawdown frente a las reglas de la cuenta ni los cambios de régimen. Por eso el gauntlet de la aplicación lo lista como un criterio entre varios.
- ¿Por qué cambia el valor p cuando vuelvo a ejecutar el gauntlet?
- La fase de permutación extrae reordenaciones al azar, así que dos ejecuciones con los mismos datos producen recuentos algo distintos. La variación se reduce a medida que crece el número de permutaciones. Si el valor p salta de un lado a otro de una frontera de decisión entre ejecuciones, la muestra te está diciendo que el resultado es marginal.