La giuria di IA, o «LLM-as-a-judge», consiste nel far valutare una risposta da più modelli linguistici nel ruolo di giudici. Incrociando modelli di fornitori diversi, si limita il bias di auto-preferenza e si ottiene una valutazione più robusta rispetto a un solo modello.

Il principio

Invece di valutare una risposta IA con un solo modello — che tenderebbe a preferire se stesso —, si convoca una giuria di più modelli giudici provenienti da fornitori diversi. Ognuno valuta la risposta secondo griglie precise (presenza, accuratezza, sentiment), poi i punteggi vengono aggregati.

Perché più giudici?

  • Anti auto-preferenza: un modello non può favorire le proprie risposte se la giuria è diversificata.
  • Robustezza: gli errori occasionali di un giudice vengono compensati dagli altri.
  • Rilevamento delle allucinazioni: un claim non verificabile individuato dai giudici fa scendere il punteggio.

Affidabilità e tracciabilità

L'accordo tra i giudici è misurato da un coefficiente di affidabilità inter-giudici. La composizione esatta della giuria di ogni audit è tracciata da un'impronta di configurazione, garantendo la comparabilità nel tempo. Questa giuria è al centro dell'AGS; vedi la metodologia e la demo.

Nelle risposte AI, un brand appare solo 1 volta su 6. Il tuo compare?

Ogni domanda posta a ChatGPT senza il tuo nome nella risposta è un competitor raccomandato al posto tuo — misurato su 6.820 risposte AI reali.