En esta página
De un vistazo
- Fórmula
- t = media ÷ (s ÷ √n), s = desviación típica muestral
- Umbral aproximado al 5 %
- |t| ≈ 1,96 en muestras grandes, bilateral
- Relación con el SQN
- SQN con σ de población = t × √[n ÷ (n − 1)]
- Debilitado por
- Dependencia, colas gruesas, contrastes múltiples
Fórmula y ejemplos
Calcula la media de los resultados, su desviación típica muestral s, y divide la media por s ÷ √n. Sesenta y cuatro operaciones con una media de +20 dólares y una desviación típica de 160 dan t = 20 ÷ (160 ÷ 8) = 1,0: la media está un error típico por encima de cero, algo que el azar produce con facilidad. Cuatrocientas operaciones con la misma media y la misma dispersión dan t = 20 ÷ (160 ÷ 20) = 2,5. La estrategia no ha mejorado; la evidencia sí.
Con muchas observaciones, la distribución t está cerca de la normal, así que un |t| por encima de 1,96 aproximadamente corresponde a un valor p bilateral por debajo del 5 % bajo el modelo. Con pocas operaciones, el umbral es más alto.
Relación con el SQN y con el ratio de Sharpe
Un ratio de Sharpe por operación es media ÷ desviación típica; multiplicarlo por √n da el estadístico t. El system quality number de Van Tharp usa la misma construcción, √n × media ÷ desviación típica. Calculado con la desviación típica de población, como en las estadísticas del Replay de Senzoukria, el SQN es igual al estadístico t multiplicado por √[n ÷ (n − 1)], un factor que vale 1,005 con 100 operaciones. Leer un SQN es por tanto leer un estadístico t, con las mismas salvedades.
Por qué el número exagera la certeza
- Las operaciones no son independientes cuando se agrupan por régimen o por sesión, lo que hace que el error típico verdadero sea mayor que s ÷ √n.
- Las colas gruesas hacen inestable la propia desviación típica en muestras pequeñas.
- Un t de 2,5 para la mejor de cincuenta configuraciones no es un t de 2,5 para una hipótesis enunciada por adelantado; la selección hay que tenerla en cuenta, por ejemplo con un ratio de Sharpe deflactado.
En Senzoukria
El informe del Replay y el panel Performance dan una línea de veredicto construida con el tamaño de muestra y el SQN: por debajo de 20 operaciones los ratios se muestran como exactos pero no significativos; con un SQN calculable, por debajo de 0 significa ningún edge en la muestra, por debajo de 1,6 débil, por debajo de 2,5 medio, y 2,5 o más «solid on this sample». Un SQN de 5 o más con menos de 100 operaciones se marca como sospechoso, porque unas pocas operaciones están entonces sosteniendo el resultado. El Gauntlet añade un ratio de Sharpe probabilístico, un Sharpe deflactado y un valor p de permutación, que relajan los supuestos de normalidad y de selección que hace un estadístico t simple.
Relacionado
En la misma sección
- Estado del flujo
- Estabilidad de parámetros
- Estimador de Corwin-Schultz
- Esperanza
- Estrategia sistemática
- Especificaciones
- Estructura temporal
- Esfuerzo y resultado
Esta página en otros idiomas
Preguntas frecuentes
- ¿Qué estadístico t debería tener una estrategia?
- Un valor cómodamente por encima de 2 sobre una hipótesis definida antes del test es el mínimo habitual para tomarse en serio un resultado. Después de buscar entre muchas configuraciones, hace falta una barra mucho más alta o una corrección explícita por el número de pruebas.
- ¿Un estadístico t es lo mismo que un valor p?
- No, pero están ligados: el valor p es la probabilidad, bajo la hipótesis nula de que no hay edge, de obtener un t al menos tan extremo como el observado. El t es la distancia; el valor p es la probabilidad de cola de esa distancia.