Das Wilson-Konfidenzintervall ist eine statistische Formel für kleine binäre Stichproben (Erfolg/Misserfolg), die einen beobachteten Score zwischen eine untere und eine obere Schranke setzt. AI Labs Audit zeigt es bei jedem Hero Grade an, um anzugeben, ob die Note statistisch belastbar oder noch fragil ist.
Warum kein einfacher Mittelwert?
Stellen Sie sich eine Marke vor, die in 4 von 5 Prompts (80 %) zitiert wird, und eine andere, die in 80 von 100 Prompts (80 %) zitiert wird. Beide haben denselben Mittelwert, aber die zweite ist viel verlässlicher. Das Wilson-Konfidenzintervall erfasst diesen Unterschied.
So liest man es
Für jeden Hero Grade zeigt AI Labs Audit z. B.:
Score: 78 / 100
Wilson-95 %-Intervall: [71; 84]
Interpretation: Mit 95 % Konfidenz liegt der wahre Score zwischen 71 und 84. Je enger das Intervall, desto solider die Note. Ein breites Intervall signalisiert, dass entweder ein Audit mit mehr Prompts erneut gestartet oder mehr historische Daten abgewartet werden sollten.
Warum Wilson statt Wald?
Die klassische Wald-Formel (Mittelwert ± Standardabweichung) ist numerisch instabil, wenn der Score nahe 0 % oder 100 % liegt und die Stichprobe klein ist (typisch für AEO/GEO-Audits mit 12–24 Prompts). Wilson bleibt in diesen Bereichen präzise und ist die von modernen statistischen Standards empfohlene Formel (Brown, Cai & DasGupta, 2001).
Wilson und AGS
Das AGS (Anti-Drift Grading System) berechnet ein Wilson-Intervall für jede Hero-Grade-Dimension und jede bewertete Antwort. So werden fragile Scores (Intervall > 15 Punkte) sofort sichtbar und im Premium-PDF entsprechend gekennzeichnet, um die Verteidigungsfähigkeit des Reports zu erhalten.
Jede Frage an ChatGPT ohne den Namen Ihres Kunden in der Antwort ist ein Wettbewerber, der an seiner Stelle empfohlen wird — gemessen an 6 820 echten KI-Antworten.