評価者間信頼性は、同じ回答を評価する複数の評価者間の一致度を測定します。高い一致度は、スコアが安定しており再現性があることを意味し、低い一致度は評価者が意見を異にする曖昧な回答を示します。
評価者パネルの一致度を測定する
AIパネルが回答を評価する際、評価者同士が一致しているかを知る必要があります。評価者間信頼性はこの一致度を定量化します。一致度が高いほど、スコアは信頼できるものになります。AGSでは、各監査についてこの係数(内部でGRCと呼んでいます)を公開しています。
何のために使うのか?
- 信頼性:高い一致度に裏付けられたスコアは堅牢です。
- 警告シグナル:著しい不一致は、曖昧な回答や検討すべき境界事例を明らかにします。
透明性
信頼区間とともに、評価者間信頼性は、各測定の堅牢性と限界を示すために表示する指標の一つです。詳細はAGS方法論をご覧ください。
AIの回答では、ブランドが登場するのは6回に1回だけです。あなたのブランドは?
ChatGPTへの質問の回答にあなたの名前がなければ、その分だけ競合があなたの代わりに推奨されています——実際のAI回答6,820件で測定。