AIジュリー、または「LLM-as-a-judge」とは、複数の言語モデルを審査員として用いて回答を評価する手法です。異なるプロバイダーのモデルを組み合わせることで、自己選好バイアスを抑制し、単一モデルよりも堅牢な評価を実現します。
基本原理
単一のモデルでAI回答を評価する場合、そのモデルは自身の回答を優遇する傾向があります。そこで、異なるプロバイダーの複数の審査モデルによるジュリーを招集します。各モデルは明確な評価基準(存在性、正確性、センチメント)に従って回答を評価し、その後スコアが集約されます。
複数の審査員が必要な理由
- 自己選好の防止:ジュリーが多様であれば、モデルが自身の回答を優遇することができません。
- 堅牢性:一人の審査員の一時的なエラーは、他の審査員によって平準化されます。
- ハルシネーションの検出:審査員によって検証不可能な主張が検出されると、スコアが低下します。
信頼性とトレーサビリティ
審査員間の一致度は審査員間信頼性係数によって測定されます。各監査のジュリーの正確な構成は設定フィンガープリントによって追跡され、時系列での比較可能性が保証されます。このジュリーはAGSの中核を成しています。詳細は方法論とデモンストレーションをご覧ください。
AIの回答では、ブランドが登場するのは6回に1回だけです。あなたのブランドは?
ChatGPTへの質問の回答にあなたの名前がなければ、その分だけ競合があなたの代わりに推奨されています——実際のAI回答6,820件で測定。