Gauntlet:回测的 GO / NO-GO / CONDITIONAL 把关器

Gauntlet 区块出现在每一次自动回测结果的下方。它会在完整周期上重跑整个参数网格,计算 PSR、DSR、置换检验 p 值、PBO 和回撤分布,然后用八条标准来回答“这个优势是真的吗?”,给出 GO、NO-GO 或 CONDITIONAL。

Senzoukria · 文档 · 更新于 2026 年 9 月


位置

位置
回放 → 自动回测 → 结果 → “Gauntlet —— 这个优势是真的吗?”
结论
GO(所有标准通过)、NO-GO(任一淘汰性标准未通过)、CONDITIONAL(仅参考性标准未通过)
额外开销
网格中每种配置各跑一次完整周期回测,公布为“gauntlet · 完整周期网格”,随后是“gauntlet · 置换”
交易日
在 America/Chicago 17:00 滚动的期货交易日,与自营公司引擎一致

它做什么

在一次运行或一次前推分析之后,runGauntlet 取出所选的交易路径(前推分析拼接起来的样本外交易,或一次简单运行的交易)以及扫描试过的网格。它在全部 K 线上重跑每一种配置,构建一个 交易日 × 配置 的盈亏矩阵,然后评判三个序列:所选路径的每日盈亏用于 PSR 和 DSR,每笔盈亏用于置换检验和回撤分布,矩阵用于 PBO。

结论本身是一个纯函数(buildVerdict)。每条标准都记录它的数值、阈值、是否具有淘汰性,以及一段可读的详情,因此该区块能够逐条说明原因,而不只是给出“NO-GO”。需要软件所不具备的输入的标准会被标记为“未评估”,既不加分也不减分。

该区块显示 PSR、DSR(高于 0.95 为绿色)、p 值(低于 0.05 为绿色)、PBO(低于 0.5 为绿色,只有一种配置时为“—”)、已试配置数,以及“回撤,95 % 的排列结果更好”。标准下方,Gauntlet 图表还给出 R 倍数、样本内与样本外曲线、20 个时段的滚动 Sharpe、不利与有利浮动区间散点图、水下时长段和参数稳定性。

各条标准

buildVerdict 的八条标准,按评估顺序排列
标准阈值权重
账户在整个运行期间存活true —— 从未触及回撤额度淘汰性;没有已保存的规则集时不评估
前推:窗口足够多,且多数样本外窗口盈利≥ 3 个窗口且 ≥ 70 % 的样本外窗口盈利参考性;简单运行时不评估
置换检验:优势可与偶然区分p 值 < 0.05淘汰性
去膨胀 Sharpe:经得起试验次数的修正DSR > 0.95淘汰性
回测过拟合概率PBO < 0.5参考性;只有一种配置时不评估
最大回撤在账户额度之内|最大回撤| < 所选规则集的考核回撤额度参考性;没有额度时不评估
挺过困难时期true评估时为淘汰性;目前不评估
自营公司周期:达到锁定,遵守不活跃规则存活、达到锁定、无时限失败参考性;选定规则集后即可评估

如何使用

请运行带扫描的前推分析,而不是单次回测:没有网格时 N = 1,DSR 会退化为对零的 PSR,PBO 无法计算,参数稳定性也没有可比对象。此时的结论虽然诚实,但很单薄。

在 Gauntlet 旁边的“我该买这份考核吗?”卡片中选择一套已保存的自营公司规则集。结论会立即用该规则集的回撤额度、账户存活和自营周期重新计算,无需再跑一次回测。GO 之下的后续步骤是固定的:在同一批数据上用第二套引擎比对盈亏,在任何出资账户之前先做两周模拟,并在启用自动驾驶之前写好一份中止计划。

局限与陷阱

  • 置换检验和回撤估计使用 10,000 次符号翻转或顺序打乱,随机种子固定;p 值是估计值,标准误约为 0.005。
  • PBO 需要矩阵中至少有 8 个交易日和至少两种配置;划分数默认为 16,数据更短时会减少到天数。
  • GO 是对你所提供的样本和网格作出的陈述。它对实盘执行、数据成本或经纪商成交没有任何说明,也不是对结果的承诺。

其他语言版本

常见问题

为什么我的结果是 CONDITIONAL 而不是 GO?
没有淘汰性标准未通过,但至少有一条参考性标准未通过:前推窗口少于三个、盈利窗口不足 70 %、PBO 达到或超过 0.5,或回撤超出所选账户的额度。每一条未通过的参考性标准都会连同其实测值作为注意事项列出。
Gauntlet 评判的是哪一种配置的稳定性?
在各折中被前推分析选中次数最多的那一种,并列时以最后一折为准;没有前推分析时则是基础配置。稳定性图表把它与在某一维度上相差一步的邻居相比较,并把该曲面标记为平台、斜坡或尖峰。
Gauntlet 需要自营公司规则集吗?
不需要。没有规则集时,账户存活、最大回撤和自营周期显示为“未评估”,并且不影响结论。加入规则集后它们才会计入。