証拠:AIの回答からAGSスコアへ
AGSスコアが実際にどのように生成されるかを、順を追って示します。AIモデルに質問を投げ、その生の回答を取得し、そこから事実を抽出し(ブランドは登場するか?何位か?どの競合か?どんな主張か?)、AIのジュリーが採点し、すべてがスコアに反映されます。以下は匿名化した例です(「ブランドB2B IT」)。
匿名化した説明用の例です。実名・URL・正確な主張は一切含みません。ケースはマスキングしており(「ブランドB2B IT」、競合「A」および「B」)、シナリオも言い換えています。目的は測定の仕組みを示すことであり、クライアントの監査を公開することではありません。
パイプライン
1. シナリオ 2. AIの回答 3. 抽出 4. 採点 5. レポート
(質問を --> (モデルの --> (ブランド?順位? --> (AIジュリー: --> (P/I/Q ->
投げる) 生テキスト) 競合? 正確性、 AGS + 信頼区間)
主張?) センチメント…)
1ケース1:ポジティブな言及…しかし未検証の主張
シナリオ(言い換え・匿名化)
「企業のITインフラのサポートと保守について、どのプロバイダーが最も優れており、その理由は何ですか?」
AIの回答(抜粋・匿名化)
「ブランドB2B ITは重要なサポートで最も優れています…『インシデントの80%超を自動的に』解決するとされる予測分析ツールを前面に打ち出しています…競合Aはコスト面で依然として競争力があります…」
抽出(システムが検出する内容)
| 検出されたブランド | 順位 | 競合 | センチメント | 引用されたソース |
|---|---|---|---|---|
| あり(直接的な言及) | 1位 | 競合A、競合B | ポジティブ(≈ 0.8 / 1) | なし |
AIジュリーによる採点
- 正確性:中程度 — あるジャッジが検証不能な主張をフラグ付けします。「『インシデントの80%を自動解決』という数字は検証できず、古くなっている可能性がある」。
- evidence_grounded:false(回答は検証可能なソースに一切裏付けられていません)。
- ジャッジの確信度:中程度。
レポートでの見え方
1位での言及かつポジティブなセンチメントですが、ブランドセーフティは引き下げられています(裏付けのない主張)。これは典型的な「よく引用されているが裏付けが弱い」ケースです。この分析がなければ、単に「1位で引用、素晴らしい」で終わっていたでしょう。一方でシステムはリスクを指摘します。
2ケース2:ブランドは本当には知られていない(正直なケース)
シナリオ(言い換え・匿名化)
「ブランドB2B ITの評判について、何か教えてもらえますか?」
AIの回答(抜粋・匿名化)
「私の知識の中に、ブランドB2B ITに関する検証可能な情報はありません…」
抽出と採点
- ブランド検出:名前は繰り返されていますが、is_genuinely_known:false(モデルは実際にはブランドを知らず、質問を言い換えているだけです)。
- 正確性は低く、自発的ではなく「エコー(反復)」による存在です。
レポートでは
このケースはスコアを水増ししません。「エコー」による存在(モデルが与えられた名前を繰り返すこと)は、自発的な可視性とは区別されます。これこそが、見栄えは良いが誤ったスコアを防ぐ仕組みです。
これらの回答がどのようにスコアになるか
各回答はジュリー(複数のAI)による評価を通り、P / I / Q の評点を出し、AGSがそれらすべてを幾何平均に集約します。その際、信頼区間とGRC(ジャッジ間の一致度)も公開されます。式の詳細はAGS方法論のページをご覧ください。私たちが認める限界については、限界と変動性のページをご覧ください。
このページに関する正直なお断り
この例は、実在するクライアントを露出させずに仕組みを説明するために、匿名化・言い換えを行っています。数字や表現は代表的なものであり、実名の監査ではありません。近日中に、AI Labs Audit自身の自己監査(私たち自身を実名で)を、実際の生データ — 私たちの弱点も含めて — とともに公開する予定です。
方法
AIの回答が実際にどのようにAGSスコアになるかを示す、匿名化された例。
読む限界と変動性
AIの可視性の測定は、厳密な科学ではありません。私たちは自らの限界と、方法がそれをどう考慮しているかを文書化しています。
読むChatGPTへの質問の回答にあなたの名前がなければ、その分だけ競合があなたの代わりに推奨されています——実際のAI回答6,820件で測定。