AGS方法論 — AI Grading System | AI Labs Audit
AGS(AI Grading System)は、AI Labs Auditの採点エンジンです。相互に較正し合う独立した評価者モデルのプールにAIの回答を評価させ、次に評価者間の信頼性係数を公開することで、あなたのスコアがどれほど擁護に足るものかがわかります。
30秒で
AGS(AI Grading System)は、AIの回答におけるブランドの可視性を測定するためのオープンな方法です。各回答について、三つのこと — ブランドは存在するか、語られている内容は好意的か、回答は信頼できるか — を、複数の独立したAIによるジュリーで採点します。最終スコアは、弱点が覆い隠されないように、これら三つの評点を組み合わせます。何よりもこれは方法です。あなたはそれを理解し、検証し、異議を唱えることができます。
この方法は、いくつかのレベルで読めます。30秒の定義、図、次元の説明、式、そして最後に再現性の付録です。マーケティング責任者も、GEOコンサルタントも、研究者も、それぞれ自分に響く詳細レベルで、皆がこの方法を理解できるはずです。
図
+---------------------------------------------+
シナリオ ---> | AIモデルの回答(ChatGPT など) |
+---------------------------------------------+
|
v
+---------------------------------------------+
| ジュリー = 複数の独立したAIジャッジ |
| (異なるプロバイダー、自己優遇の防止) |
+---------------------------------------------+
|
+--------------------------+--------------------------+
v v v
P - 存在 I - 影響力 Q - 品質
(M, RP, WC) (INF, UNQ, REL) (SENT, ACC)
+--------------------------+--------------------------+
v
AGS = (P x I x Q) ^ (1/3)
(幾何平均:一つの次元がゼロだと
スコアが崩壊する)
幾何平均は意図的です。存在の欠如を良好なセンチメントで埋め合わせることはできません。従来の平均よりはるかに水増ししにくいのです。
AGSとは?
AGSは、オープンソースのマルチモデル・スコアリングプロトコルです。単一のLLMに頼ってブランドの可視性を評価する(バイアス、ハルシネーション、モデルのドリフト)代わりに、AGSは異なるプロバイダーのモデルのプールに評価を分散し、それらの間の差を公開します。差が小さいほど、スコアの信頼性は高まります。
評価される3つの次元
- P(精度):回答は、あなたのブランドを、競合や同名の別物と混同することなく正しく言及しているか?ハルシネーションと帰属の誤りを測定します。
- I(情報性):回答は、あなたのブランドについて有用で差別化された情報を提供しているか、それとも単に名前を挙げているだけか?引用の深さを測定します。
- Q(品質):回答は、事実として正確で最新か?情報の鮮度と、検証可能な事実への適合を測定します。
式(公開された方法、独自の重み付け)
AGS = (P x I x Q) ^ (1/3)、各次元は0から100で採点されます。各次元は、サブメトリクスの加重的な組み合わせです:
- P — 存在(Présence)= 言及(M)、順位/ポジション(RP)、カバレッジ(WC)の組み合わせ。
- I — 影響力(Influence)= 情報性(INF)、独自性(UNQ)、関連性(REL)の組み合わせ。
- Q — 品質(Qualité)= センチメント(SENT)と正確性(ACC)の組み合わせ。
重み付けの正確な値は、私たちの独自の方法論の一部です。正規化され(合計 = 1)、較正・バージョン管理され、judge_config_hashによって追跡されます(これにより、同じハッシュを共有する二つの監査が厳密に比較可能であることが保証されます)。私たちは方法 — 構造、幾何平均、次元、サブメトリクス、ジュリー、信頼性 — を公開しますが、私たちのノウハウにあたる正確な重み付けは開示しません。
ジュリーと再現性
各回答は、モデルが自分自身を優遇しないよう、異なるプロバイダーの複数のジャッジモデルによって採点されます。公開時点では、ジュリーはたとえばOpenAI、Anthropic、Google、Mistral、DeepSeekのモデルを組み合わせています — ただしモデルは進化します。このリストは現時点での一例であり、固定的な約束ではありません。
各監査の実際の構成(モデル + 重み + ルーブリック)は、そのjudge_config_hash(SHA-256)によって追跡されます。これが安定した基準です。同じハッシュを共有する二つの監査は厳密に比較可能であり、ジュリーの変更はすべて追跡されます。
- GRC:各監査ごとに公開される、ジャッジ間の信頼性係数(ジャッジ間の一致の度合い)。
- 存在スコアに表示される信頼区間:単なる数字ではなく、不確実性が示されます。
- Anchor set:継続的に再測定される基準ブランドのパネルが、モデルのドリフトを検出します。クライアントのスコアは、このドリフトを補正されます。
評価プロトコル
監査対象の各シナリオについて、AGSは評価者モデルに同一の指示を送ります(ゼロショットスコアリング)。評価はプール上でローテーションして配分され、その一部を二重化して評価者間の一致を測定します。スコアはその後、集約・較正されます。最終結果には、平均スコア、評価者間の差、そして95%のブートストラップ信頼区間が含まれます。
ジャッジ間信頼性係数
AGSは、各監査ごとにFleissのカッパ係数(複数評価者間の一致度の指標)を公開します。0.80を超えるカッパは、ジャッジ間の強い合意を示します(非常に信頼できるスコア)。0.60〜0.80:中程度の合意。0.60未満:弱い合意 — スコアは慎重に解釈し、質問を言い換えるべきです。
透明性と再現性
各AGS監査は、シナリオ、生の回答、個々のスコアの暗号学的ハッシュを生成します。この署名により、スコアが改ざんされていないことを証明できます。AGSのコードはgithub.com/sarsator/aqa-specificationでオープンソース(MITライセンス)として公開され、スコアリング式はバージョン管理され公開されています。どのクライアントも、スコアを検証または異議申し立てできます。
AGSの頭字語
- GRC
- Generative Response Coverage:少なくとも1つの審査者がブランドを引用したシナリオの割合。
- GIS
- Generative Inclusion Score:回答内でのブランドの位置で重み付けした平均スコア(最初に言及された場合=100%、最後の場合=0%)。
- ASR
- Answer Sentiment Rating:言及のトーン(ポジティブ/ニュートラル/ネガティブ)を-1から+1のスケールで表します。
- BVI
- Brand Visibility Index:0から100までの複合スコア(GRC × GIS × ASR)で、テスト対象のAIにおけるブランドの総合的なパフォーマンスを要約します。
- CIA
- Citation Inter-judge Agreement:引用の有無について評価モデル間の一致を測定する、Fleissのカッパ係数です。
30の高度なGEOチェック 2026
Sprint 15では、パッシブに測定される30の新しいGEO/AEOシグナルを提供しました(ToS違反のスクレイピングはゼロ)。これらのシグナルは、6番目のカテゴリー「advanced_signals」(複合スコアの重み15%)を通じてAGSスコアリングを補完します。
6つの市場差別化要因
- A08 — Specificity score (Princeton GEO 2024) — tier-1の出典付き統計の密度(Princeton GEO KDD 2024:LLM引用が+27〜+40%)。
- A09 — Counter-arguments markers — バランスの取れた論証のマーカーを測定する競合ツールは存在しません。
- A07 — Date-stamped statements
- S05 — Common Crawl inclusion
- S08 — llms.txt RFC validation
- B10 — Stack Overflow brand mentions
モジュール6 — 外部権威シグナル
外部の権威シグナルに特化した新しいモジュール:LinkedIn、ProductHunt、G2/Capterra、Stack Overflow、GitHub、Substack/Medium。
GEOモジュール別のチェック
- SSR / クロール可能性
- mainEntity · QAPage · 動画のtranscript · Speakable · @graph @id · inLanguage · Common Crawl · llms.txt · IndexNow · ai.txt · 検証 · HTTP/3 · Brotli
- Entity Health
- Wikidata · DBpedia
- Citation Readiness
- 出典付き統計 · 論証のバランス · インラインの日付付け · ItemList · Dataset · Blockquote cite · 内部リンク · Anchor entropy · ニュースサイトマップ
- External Authority
- Stack Overflow · LinkedIn · GitHub · ProductHunt · B2B reviews · Newsletter
すべてのチェックはsafe_external_call(リトライ+キャッシュ+サーキットブレーカー)を使用し、その結果をaudits.advanced_checks_v2(JSONB+GINインデックス)に保存します。
ブログの詳細記事:30の新しいGEO/AEOシグナル2026 — 検証済みの最新動向。
私たちが測定するもの、そして測定しないもの
私たちが測定するもの
私たちは、AIモデルを公式APIを通じて、ネイティブモード(ナビゲーションなしのモデルの記憶)とウェブモード(オンライン検索を有効化)で照会し、再現可能な質問を用います。各監査はその構成の暗号学的な指紋を計算するため、比較される2つの監査は実際に比較可能です。
デフォルトのパネルは、一般の人々が実際に使用する製品(ChatGPT、Gemini、Perplexity、Claude、Mistralなど)に合わせて構成され、ダッシュボードには各エンジンの実際のオーディエンスシェアで重み付けした可視性が表示されます(出典はStatcounter/SimilarWeb、日付付きで見直し済み)。
私たちが測定しないもの
APIで得た回答は、同じ製品の一般向けインターフェースとは異なる場合があります。会話メモリ、独自の指示、位置情報、提供元のA/Bテストなどが原因です。私たちが測定するのはエンジンであり、ログイン済みユーザーのパーソナライズされたセッションではありません。
AIの回答は確率的です。同じ質問でも異なるバリエーションが生じることがあります。だからこそ、単一のテストではなく、数十の質問について信頼区間を用いて測定します。
重み付けに使用するオーディエンスシェアは、第三者による推計で、日付が付され、定期的に見直されています。検証不能な社内の数字ではありません。
なぜ私たちの限界を明文化するのか。それは、範囲の分からない測定には何の価値もないからです。これこそ、私たちのスコアがあなたのクライアントの前で弁明可能であるための条件です。
限界と変動性
AIの可視性の測定は、厳密な科学ではありません。私たちは自らの限界と、方法がそれをどう考慮しているかを文書化しています。
読む証拠を、順を追って
AIの回答が実際にどのようにAGSスコアになるかを示す、匿名化された例。
読む