La fiabilité inter-juges mesure le degré d'accord entre plusieurs juges notant la même réponse. Un accord élevé signifie que la note est stable et reproductible ; un accord faible signale une réponse ambiguë sur laquelle les juges divergent.
Mesurer l'accord du jury
Quand un jury d'IA note une réponse, encore faut-il savoir si les juges sont d'accord entre eux. La fiabilité inter-juges quantifie cet accord : plus il est fort, plus la note est digne de confiance. Dans l'AGS, nous publions ce coefficient (que nous appelons GRC en interne) pour chaque audit.
À quoi ça sert ?
- Confiance : un score adossé à un accord fort est solide.
- Signal d'alerte : un désaccord marqué révèle une réponse ambiguë ou un cas limite à examiner.
Transparence
Avec l'intervalle de confiance, la fiabilité inter-juges fait partie des indicateurs que nous affichons pour montrer la robustesse — et les limites — de chaque mesure. Détail sur la méthodologie AGS.
답변에 귀사의 이름이 없는 ChatGPT에 대한 모든 질문은 귀사 대신 추천되는 경쟁사입니다 — 6,820개의 실제 AI 답변에서 측정되었습니다.