Wilson信頼区間は、小規模な二値サンプル(成功/失敗)に適した統計式で、観測されたスコアを下限と上限で区切ります。AI Labs Auditは各Hero Gradeに対してこれを表示し、スコアが統計的に堅固か、まだ脆弱かを示します。
なぜ単純平均ではないのか?
ある企業が5プロンプト中4回引用された(80%)場合と、別の企業が100プロンプト中80回引用された(80%)場合を想像してください。両者は同じ平均ですが、後者ははるかに信頼性が高いです。Wilson信頼区間はこの違いを捉えます。
どう読むか?
各Hero Gradeについて、AI Labs Auditは例えば次のように表示します:
スコア:78 / 100
Wilson 95%区間:[71 ; 84]
読み方:95%の信頼度で、実際のスコアは71から84の間にあります。区間が狭いほど、スコアは堅固です。区間が広い場合は、より多くのプロンプトで監査を再実行するか、より多くの履歴データを待つ必要があることを示します。
なぜWaldではなくWilsonか?
古典的なWald式(平均±標準偏差)は、スコアが0%または100%に近く、サンプルが小さい場合(AEO/GEO監査の12-24プロンプトで典型的)に数値的に不安定です。Wilsonはこれらの領域でも正確であり、現代の統計標準で推奨される式です(Brown, Cai & DasGupta, 2001)。
WilsonとAGS
AGS(Anti-Drift Grading System)は、Hero Gradeの各次元と判定された各回答に対してWilsonを計算します。これにより、脆弱なスコア(区間が15ポイント超)を即座に検出し、レポートの防御可能性を維持するためにPremium PDFに注釈を付けることができます。
ChatGPTへの質問の回答にあなたの名前がなければ、その分だけ競合があなたの代わりに推奨されています——実際のAI回答6,820件で測定。