Biais de data snooping (multi-testing)

Le biais de data snooping est la surestimation d'un résultat qui vient du fait d'avoir testé de nombreuses règles, paramètres ou variantes sur les mêmes données et d'avoir gardé le meilleur. Plus il y a de tentatives, plus il est probable que le gagnant doive sa performance au hasard : le résultat rapporté doit donc se juger au regard du nombre d'essais qui l'ont produit.

Senzoukria · Glossaire · Mis à jour en septembre 2026


En bref

Autres noms
Multi-testing, biais de sélection, p-hacking
20 règles inutiles à 5 %
64 % de chances qu'au moins une paraisse significative
Tests formels
Reality Check de White (2000), test SPA de Hansen (2005), Sharpe déflaté, PBO
Dans Senzoukria
Balayage borné à 400 combinaisons ; le DSR compte toute la grille

Pourquoi le meilleur d'un grand nombre est surestimé

Testez une règle sans edge au seuil de signification de 5 % : il y a 5 % de chances de faux positif. Testez vingt règles indépendantes sans edge, et la probabilité qu'au moins une passe vaut 1 − 0,95²⁰ ≈ 64 %. Les statistiques de la règle gagnante sont authentiques pour cette règle sur ces données, mais le processus qui l'a trouvée aurait trouvé quelque chose de toute façon. Le maximum de nombreux résultats bruités est biaisé vers le haut par construction ; c'est une propriété des maxima, pas des marchés.

Halbert White a formalisé un test pour cette situation en 2000, le Reality Check, qui compare la meilleure règle à la distribution du meilleur d'un grand nombre de règles sous l'hypothèse nulle d'absence d'edge. Le test de supériorité prédictive de Peter Hansen (2005) l'a raffiné. Le ratio de Sharpe déflaté et la probabilité de sur-ajustement du backtest abordent le même problème sous d'autres angles.

Les essais que personne ne compte

  • Changer la fenêtre de séance, le type de barre ou l'instrument après un premier coup d'œil aux résultats.
  • Ajouter un filtre parce que la courbe d'équité a eu un mauvais mois, puis le garder.
  • Partir d'une idée qui fonctionnait déjà dans le backtest de quelqu'un d'autre sur la même période.
  • Relancer un walk-forward avec un autre critère de sélection jusqu'à ce que l'efficacité paraisse acceptable.
  • Chacun de ces gestes est un essai. Une correction formelle ne fonctionne que si le décompte les inclut.

Dans Senzoukria

Le balayage de paramètres et le walk-forward du backtest automatique refusent les grilles au-delà de 400 combinaisons, et l'assistant de backtest a pour instruction de garder les balayages sous 100. Le walk-forward rapporte un Sharpe déflaté de ses trades hors échantillon, dans lequel le nombre d'essais est le nombre de configurations parmi lesquelles la sélection a choisi. Le Gauntlet relance toute la grille sur la période entière, calcule le Sharpe déflaté avec N égal à la grille entière plutôt qu'aux configurations retenues, estime la probabilité de sur-ajustement du backtest quand au moins huit journées de séance sont disponibles, et ajoute un test de permutation du ratio de Sharpe. Ce que le logiciel ne peut pas voir, c'est l'historique de vos runs antérieurs : une grille lancée après dix grilles abandonnées est comptée comme un seul ensemble d'essais.

Contre-mesures pratiques

  • Écrire l'hypothèse, la grille et le critère de sélection avant de regarder les résultats.
  • Tenir un registre de recherche de chaque variante essayée, y compris celles abandonnées.
  • Réserver une période finale qu'aucune décision n'a touchée, et l'employer une seule fois.
  • Préférer les règles dont les voisines sur la grille fonctionnent aussi à une meilleure case isolée.

Dans la même rubrique

Cette page dans d’autres langues

Questions fréquentes

Le data snooping est-il la même chose que le sur-ajustement ?
Les deux sont étroitement liés. Le sur-ajustement décrit une règle réglée sur les accidents d'un échantillon. Le data snooping décrit le processus de sélection : essayer de nombreuses règles ou variantes et garder la meilleure. Le snooping est l'une des principales façons de produire des règles sur-ajustées.
Une analyse walk-forward peut-elle supprimer le biais de data snooping ?
Elle le réduit pour les paramètres choisis à l'intérieur de la procédure, parce que chaque choix est évalué sur des données qu'il n'a pas vues. Elle ne corrige pas les choix faits en dehors, comme la famille de règles, l'instrument ou le nombre de walk-forwards lancés avant celui que vous rapportez.

À lire ensuite