L'affidabilità inter-giudici misura il grado di accordo tra più giudici che valutano la stessa risposta. Un accordo elevato significa che il punteggio è stabile e riproducibile; un accordo basso segnala una risposta ambigua su cui i giudici divergono.
Misurare l'accordo della giuria
Quando una giuria di IA valuta una risposta, resta da sapere se i giudici sono d'accordo tra loro. L'affidabilità inter-giudici quantifica questo accordo: più è forte, più il punteggio è degno di fiducia. Nell'AGS, pubblichiamo questo coefficiente (che chiamiamo internamente GRC) per ogni audit.
A cosa serve?
- Fiducia: un punteggio sostenuto da un forte accordo è solido.
- Segnale di allerta: un disaccordo marcato rivela una risposta ambigua o un caso limite da esaminare.
Trasparenza
Insieme all'intervallo di confidenza, l'affidabilità inter-giudici fa parte degli indicatori che mostriamo per evidenziare la robustezza — e i limiti — di ogni misura. Dettagli sulla metodologia AGS.
Ogni domanda posta a ChatGPT senza il tuo nome nella risposta è un competitor raccomandato al posto tuo — misurato su 6.820 risposte AI reali.