既知の限界と測定の変動性
生成AIにおけるブランドの可視性を測定することは、厳密な科学ではありません。モデルは非決定的で、時間とともに進化します。この現実を「きれいな」スコアの背後に隠すのではなく、私たちはそれを文書化し、私たちの方法がそれをどのように考慮しているかを説明します。
1AIの回答は実行のたびに変わります
同じシナリオでも、そのときどきやモデルのランダム性によって異なる回答になることがあります(観測される変動は、一部のクエリで通常15〜20%程度です)。
私たちの答え : 複数モデルによる評価、堅牢な集約、そして表示される信頼区間 — 単なる数字ではなく、不確実性の幅が見えます。
2各モデルには固有の挙動があります
モデルは一様ではありません。技術的なソースをより多く引用するものもあれば、ローカルなクエリで不安定なもの、言語によって変動するものもあります。
私たちの答え : 全体を一つの評点にまとめてこうした差を覆い隠すのではなく、マルチモデル監査(複数のジャッジ、数十のモデルへの照会)とモデルごとの詳細をレポートに記載します。
3プロバイダーがモデルを変更するとスコアが変動します
OpenAI、Google、Anthropicがモデルを更新すると、ブランドが何も変えていなくても、回答 — ひいてはスコア — が変動することがあります。
私たちの答え : anchor set(継続的に再測定される基準ブランド)が、このモデルのドリフトをブランドの実際のパフォーマンスから切り分けます。クライアントのスコアはそれに応じて補正されます。
4一時点の測定だけでは不十分です
AIの可視性は時間とともに不安定です。一度きりの測定では誤解を招きます。
私たちの答え : スケジュール/定期監査とトレンド追跡 — スナップショットではなく推移を見ます。
5「Web検索」対「モデルのメモリ」の割合
回答は、モデルがWeb検索(リトリーバル)を行ったか、内部メモリ(パラメトリック)から答えたかによって変わります。
私たちの答え : 両者を区別し、どのレバーを引くべきかを知るための、ネイティブ対Webの差分診断。
6結果はシナリオの言い回しに左右されます
同じ質問でも尋ね方が二通りあれば、異なる回答 — ひいては異なるスコア — が生じることがあります。
私たちの答え : 標準化・バージョン管理・文書化されたシナリオ(意図別のシナリオ分類)。質問を即興で作るのではなく、再現可能なプロトコルを適用し、時間を通じて同じ基準表に従います。
7地理的・言語的コンテキストが回答を変えます
AIは、国(フランス、ベルギー、カナダ、米国など)や言語によって異なる回答をすることがあります。
私たちの答え : 各監査は、文書化された言語的・地理的コンテキストで実施されます(市場のコンテキスト化とローカル競合を伴う言語別監査)。コンテキストのない「浮ついた」スコアではなく、どの市場で測定したかを常に明示します。
これが正直に意味すること
AGSは、較正され再現可能な推定値であり、絶対的な真実ではありません。時間を通じて比較できるよう(同一のjudge_config_hash)、また不確実性について正直であるよう(信頼区間、GRC、補正されたドリフト)設計されています。私たちの目標は、見栄えの良い数字ではなく、あなた — そしてあなたのクライアント — が理解し、検証し、異議を唱えられる測定です。
方法
AIの可視性の測定は、厳密な科学ではありません。私たちは自らの限界と、方法がそれをどう考慮しているかを文書化しています。
読む証拠を、順を追って
AIの回答が実際にどのようにAGSスコアになるかを示す、匿名化された例。
読む