GRC(Generalized Reliability Coefficient)評価者間信頼性は、AGSの5つのLLM judges間の一貫性を測定する指標です。1に近いほど評価者間の一致度が高く、0に近いほど最終スコアに議論の余地があり、信頼性が低いことを示します。
なぜ評価者間の一致度を測定するのか?
AGSは5つのLLM judges(Claude、GPT-4、Gemini、Llama、Mistral)を活用しています。5つすべてが一致すれば、最終スコアは堅固です。しかし、3つがAと評価し、2つがFと評価した場合、平均はCになりますが、この平均は不一致を隠しており、それを示す必要があります。これがGRCの役割です。
どのように解釈するか?
- GRC = 1.0:完全な一致。5つの評価者すべてが同じスコアを付けています。
- GRC ≥ 0.8:非常に良い一致。スコアはそのまま信頼できます。
- GRC 0.5~0.8:中程度の一致。スコアは使用可能ですが、Wilson信頼区間はより広くなります。
- GRC < 0.5:強い不一致。AI Labs AuditはプレミアムPDFでこの次元を「議論の余地あり」として注釈し、再監査またはアクションプランでこの次元を優先することを提案します。
Hero Gradesとの関連
GRCはHero Gradeの各次元(引用、順位、センチメント、カバレッジ、権威性、認識)に対して計算されます。ダッシュボードとPDFでWilsonと併せて表示され、GEOコンサルタントがクライアントに対して各ポイントを厳密に説明できるようにします。
AIの回答では、ブランドが登場するのは6回に1回だけです。あなたのブランドは?
ChatGPTへの質問の回答にあなたの名前がなければ、その分だけ競合があなたの代わりに推奨されています——実際のAI回答6,820件で測定。