L’intervalle de confiance Wilson est une formule statistique adaptée aux petits échantillons binaires (succès/échec) qui borne un score observé entre une borne basse et une borne haute. AI Labs Audit l’affiche pour chaque Hero Grade afin d’indiquer si la note est statistiquement solide ou encore fragile.
Pourquoi pas une moyenne simple ?
Imaginez une marque citée 4 fois sur 5 prompts (80 %) et une autre citée 80 fois sur 100 prompts (80 %). Les deux ont la même moyenne, mais la seconde est beaucoup plus fiable. L’intervalle de confiance Wilson capture cette différence.
Comment se lit-il ?
Pour chaque Hero Grade, AI Labs Audit affiche par exemple :
Score : 78 / 100
Intervalle Wilson 95 % : [71 ; 84]
Lecture : avec 95 % de confiance, le score réel se situe entre 71 et 84. Plus l’intervalle est étroit, plus la note est solide. Un intervalle large signale qu’il faut soit relancer un audit avec plus de prompts, soit attendre plus de données historiques.
Pourquoi Wilson plutôt que Wald ?
La formule classique de Wald (moyenne ± écart-type) est numériquement instable quand le score est proche de 0 % ou 100 % et quand l’échantillon est petit (typique des audits AEO/GEO sur 12-24 prompts). Wilson reste précise dans ces zones et est la formule recommandée par les standards statistiques modernes (Brown, Cai & DasGupta, 2001).
Wilson et AGS
L’AGS (Anti-Drift Grading System) calcule un Wilson sur chaque dimension du Hero Grade et sur chaque réponse jugée. Cela permet de détecter immédiatement les scores fragiles (intervalle > 15 points) et de les annoter dans le PDF Premium pour préserver la défensibilité du rapport.
Chaque question posée à ChatGPT sans votre nom dans la réponse, c'est un concurrent qui est recommandé à votre place — mesuré sur 6 820 réponses d'IA réelles.