Test di sovradattamento: Sharpe deflazionato, PBO, permutazione e stabilità
Senzoukria misura se il risultato di un backtest sopravvive al numero di configurazioni provate: rapporti di Sharpe probabilistico e deflazionato, probabilità di sovradattamento del backtest (CSCV), un test di permutazione per inversione di segno, una distribuzione dei drawdown per rimescolamento d'ordine e un controllo di stabilità dei parametri. Tutto è calcolato in locale dopo un backtest automatico.
Senzoukria · Documentazione · Aggiornato a settembre 2026
Dove trovarlo
- Dove
- Replay → Backtest automatico → risultato → blocco Gauntlet e riga «Sharpe deflazionato — probabilità di un edge reale» del walk-forward
- Riferimenti
- Bailey & López de Prado (2014) per PSR/DSR; Bailey, Borwein, López de Prado & Zhu (2015) per il PBO
- Permutazioni
- 10.000 estrazioni, seme 0, deterministiche
- PBO
- 16 blocchi contigui per impostazione predefinita, ≥ 8 giornate di sessione, ≥ 2 configurazioni
A che cosa risponde ogni test
| Statistica | Dati e metodo | Soglia |
|---|---|---|
| PSR | P&L giornaliero del percorso scelto; probabilità che lo Sharpe vero superi 0, corretta per lunghezza del campione, asimmetria e curtosi; 0 sotto le 5 osservazioni | Informativa |
| DSR | Stessa serie, ma il riferimento è lo Sharpe atteso dal migliore di N configurazioni senza edge, scalato dalla varianza degli Sharpe della griglia | > 0,95 per passare (eliminatoria) |
| p-value | P&L per operazione; segno di ogni operazione invertito a caso 10.000 volte; p = (1 + conteggio ≥ osservato) / (1 + n) | < 0,05 per passare (eliminatoria) |
| PBO | Matrice giornata di sessione × configurazione; per ogni divisione a metà di 16 blocchi, rango fuori campione della migliore configurazione dentro campione | < 0,5 per passare (indicativa) |
| configurazioni provate | Numero di combinazioni della griglia (N), l'intera esplorazione, non solo quelle tenute | Alimenta il DSR |
| Drawdown, il 95 % degli ordinamenti fa meglio | P&L per operazione rimescolato 10.000 volte; 5° percentile del drawdown massimo | Informativa |
| Stabilità dei parametri | Sharpe di griglia della configurazione scelta contro i vicini a un passo su un asse | altopiano ≥ 0,7 di rapporto mediano e nessun vicino negativo; picco < 0,4 o un vicino negativo |
La riga del walk-forward
Indipendentemente dal Gauntlet, il risultato del walk-forward porta il proprio Sharpe deflazionato (lib/quant/overfit.ts) calcolato sulle operazioni fuori campione. Mostra lo Sharpe per operazione contro la soglia prodotta dalla sola selezione, sul numero di configurazioni provate e di operazioni fuori campione, e riassume la probabilità in una parola: solido da 0,95 in su, fragile fra 0,5 e 0,95, rumore sotto 0,5.
Le due implementazioni differiscono di proposito. La riga del walk-forward lavora sui rendimenti per operazione e usa come dispersione la deviazione standard di tutti gli Sharpe provati attraverso i fold. Il Gauntlet lavora sul P&L per giornata di sessione e prende la dispersione dalla griglia sul periodo completo. Un'esecuzione senza esplorazione ha N = 1 e varianza nulla, quindi il DSR si riduce al PSR contro zero, che è ciò che deve essere quando non è stato selezionato nulla.
Come usarli
- Leggi prima il p-value: se il test per inversione di segno non riesce a distinguere lo Sharpe dal caso, il resto è privo di senso.
- Poi il DSR: uno Sharpe grezzo alto con un DSR sotto 0,95 significa che il numero di configurazioni spiega buona parte del risultato. Restringi l'esplorazione o allunga il periodo.
- Un PBO vicino a 0,5 è caso; sopra, scegliere la migliore configurazione dentro campione danneggia attivamente fuori campione.
- Preferisci un altopiano a un picco nel grafico di stabilità: una regola che funziona attorno ai propri parametri sopravvive al mercato che si sposta di un passo da solo.
Limiti e trappole
Questi test correggono la selezione e la non normalità dentro il campione che gli hai dato. Non vedono i dati mai caricati, una strategia modificata dopo un verdetto negativo, né una seconda esplorazione lanciata sulle stesse barre. Ogni nuova esecuzione è un'altra estrazione che il contatore non conosce.
Un P&L degenere (meno di due operazioni o deviazione standard nulla) restituisce un p-value di 1 e uno Sharpe di 0. Meno di cinque osservazioni giornaliere restituiscono PSR = 0. Sono rifiuti a concludere, non misure di una strategia cattiva.
Superare tutti i test è un'affermazione su un campione; non è una promessa di risultati live.
Pagine correlate
- Verdetto del Gauntlet
- Esplorazione dei parametri
- Monte Carlo sui conti
- Trading quantitativo per principianti
- Come testare una strategia di trading
Questa pagina in altre lingue
Domande frequenti
- Perché il PBO è mostrato come «—»?
- La griglia aveva una sola configurazione, oppure per la matrice erano disponibili meno di 8 giornate di sessione. Il PBO richiede almeno due configurazioni e blocchi contigui sufficienti per dividerli a metà.
- Perché il DSR è più basso del PSR?
- Il PSR si confronta con zero; il DSR si confronta con lo Sharpe che il migliore di N configurazioni casuali raggiungerebbe. Con più prove o una dispersione più ampia degli Sharpe di griglia, quel riferimento sale e il DSR scende.
- I risultati delle permutazioni sono riproducibili?
- Sì. Il generatore è lo stesso mulberry32 usato dal motore prop firm, con seme 0 per impostazione predefinita, quindi le stesse operazioni danno lo stesso p-value e gli stessi percentili a ogni esecuzione.