Méthodologie

GRC (Generalized Reliability Coefficient) inter-juges

Le GRC (Generalized Reliability Coefficient) inter-juges est une métrique de cohérence entre les 5 LLM judges de l’AGS. Plus il est proche de 1, plus les juges sont d’accord ; plus il est proche de 0, plus la note finale est sujette à débat et donc à fragilité.

Pourquoi mesurer l’accord entre juges ?

L’AGS mobilise 5 LLM judges (Claude, GPT-4, Gemini, Llama, Mistral). Si les 5 sont d’accord, la note finale est solide. Si 3 trouvent A et 2 trouvent F, la moyenne sera C, mais cette moyenne cache un désaccord qu’il faut signaler. C’est le rôle du GRC.

Comment se lit-il ?

  • GRC = 1.0 : accord parfait. Les 5 juges donnent la même note.
  • GRC ≥ 0.8 : très bon accord. La note est défendable telle quelle.
  • GRC entre 0.5 et 0.8 : accord modéré. La note reste utilisable mais l’intervalle Wilson sera plus large.
  • GRC < 0.5 : désaccord fort. AI Labs Audit annote la dimension comme « controversée » dans le PDF Premium et propose de relancer un audit ou de prioriser cette dimension dans le plan d’action.

Lien avec les Hero Grades

Le GRC est calculé pour chaque dimension du Hero Grade (citations, position, sentiment, couverture, autorité, perception). Il s’affiche en complément du Wilson dans le dashboard et le PDF, permettant aux consultants GEO de défendre rigoureusement chaque point auprès du client.

Sur les réponses des IA, une marque n'apparaît qu'1 fois sur 6. Et la vôtre ?

Chaque question posée à ChatGPT sans votre nom dans la réponse, c'est un concurrent qui est recommandé à votre place — mesuré sur 6 820 réponses d'IA réelles.