La giuria di IA, o «LLM-as-a-judge», consiste nel far valutare una risposta da più modelli linguistici nel ruolo di giudici. Incrociando modelli di fornitori diversi, si limita il bias di auto-preferenza e si ottiene una valutazione più robusta rispetto a un solo modello.
Il principio
Invece di valutare una risposta IA con un solo modello — che tenderebbe a preferire se stesso —, si convoca una giuria di più modelli giudici provenienti da fornitori diversi. Ognuno valuta la risposta secondo griglie precise (presenza, accuratezza, sentiment), poi i punteggi vengono aggregati.
Perché più giudici?
- Anti auto-preferenza: un modello non può favorire le proprie risposte se la giuria è diversificata.
- Robustezza: gli errori occasionali di un giudice vengono compensati dagli altri.
- Rilevamento delle allucinazioni: un claim non verificabile individuato dai giudici fa scendere il punteggio.
Affidabilità e tracciabilità
L'accordo tra i giudici è misurato da un coefficiente di affidabilità inter-giudici. La composizione esatta della giuria di ogni audit è tracciata da un'impronta di configurazione, garantendo la comparabilità nel tempo. Questa giuria è al centro dell'AGS; vedi la metodologia e la demo.
Ogni domanda posta a ChatGPT senza il tuo nome nella risposta è un competitor raccomandato al posto tuo — misurato su 6.820 risposte AI reali.