要点
- 公式
- t = 均值 ÷ (s ÷ √n),s 为样本标准差
- 5% 的粗略门槛
- 大样本上双侧 |t| ≈ 1.96
- 与 SQN 的联系
- 用总体 σ 算出的 SQN = t × √[n ÷ (n − 1)]
- 会被什么削弱
- 相依性、厚尾、多重检验
公式与例子
算出交易结果的均值、它们的样本标准差 s,然后用均值除以 s ÷ √n。六十四笔交易、均值 +20 美元、标准差 160,给出 t = 20 ÷ (160 ÷ 8) = 1.0:这个均值在零之上一个标准误,而偶然很容易产生这个结果。四百笔交易、同样的均值和离散度,给出 t = 20 ÷ (160 ÷ 20) = 2.5。策略没有变好;是证据变强了。
在观测很多时,t 分布接近正态分布,所以在这个模型下 |t| 超过约 1.96 对应一个低于 5% 的双侧 p 值。在交易笔数很少时,这个门槛更高。
和 SQN 以及夏普比率的关系
一个按笔的夏普比率是均值 ÷ 标准差;把它乘上 √n 就得到 t 统计量。范·撒普的系统质量数用的是同一个构造:√n × 均值 ÷ 标准差。
如果像 Senzoukria 回放统计里那样用总体标准差来算,SQN 等于 t 统计量乘以 √[n ÷ (n − 1)],而这个因子在 100 笔交易时是 1.005。所以读一个 SQN 就是在读一个 t 统计量,带着同样的那些保留条件。
为什么这个数字会高估确定性
- 当交易按市场状态或者按时段聚集时,它们并不独立,而这让真实的标准误大于 s ÷ √n。
- 厚尾让标准差本身在小样本上不稳定。
- 五十个配置里最好那一个的 t = 2.5,不等于一个事先声明的假设的 t = 2.5;这个选择过程必须被计入,比如用一个紧缩夏普比率。
在 Senzoukria 里
回放报告和性能面板给出一行建立在样本量和 SQN 之上的结论:少于 20 笔交易时,这些比率被显示为精确但不显著;在 SQN 可计算时,低于 0 意味着这个样本里没有优势,低于 1.6 为弱,低于 2.5 为一般,而 2.5 或以上为「在这个样本上扎实」。
在少于 100 笔交易上出现 5 或以上的 SQN 会被标为可疑,因为此时是寥寥几笔交易在撑着这个结果。Gauntlet 再加上概率夏普比率、紧缩夏普和一个置换检验的 p 值,而这些放松了一个朴素 t 统计量所做的正态性和选择性假设。
相关内容
同一栏目
其他语言版本
常见问题
- 一个策略该有多高的 t 统计量?
- 在一个测试之前就定义好的假设上,一个舒舒服服高于 2 的数值,是把结果当真的通常最低要求。而在一次跨越许多配置的搜索之后,需要一个高得多的标准,或者一个针对尝试次数的明确校正。
- t 统计量和 p 值是一回事吗?
- 不是,但两者相连:p 值是在「没有优势」这个原假设下,出现一个至少和所观察到的这个一样极端的 t 的概率。t 是那个距离;p 值是那个距离的尾部概率。