Méthodologie

GRC inter-giudici (Generalized Reliability Coefficient)

Il GRC inter-giudici (Generalized Reliability Coefficient) è una metrica di coerenza tra i 5 giudici LLM dell'AGS. Più il valore si avvicina a 1, più i giudici concordano; più si avvicina a 0, più il punteggio finale è controverso e quindi fragile.

Perché misurare l'accordo tra giudici?

L'AGS mobilita 5 giudici LLM (Claude, GPT-4, Gemini, Llama, Mistral). Quando tutti e 5 concordano, il punteggio finale è solido. Quando 3 dicono A e 2 dicono F, la media è C — ma quella media nasconde un disaccordo che andrebbe messo in luce. Questo è il ruolo del GRC.

Come leggerlo

  • GRC = 1.0: accordo perfetto. Tutti e 5 i giudici assegnano lo stesso voto.
  • GRC ≥ 0.8: forte accordo. Il voto può essere difeso così com'è.
  • GRC tra 0.5 e 0.8: accordo moderato. Il voto è ancora utilizzabile, ma l'intervallo di Wilson sarà più ampio.
  • GRC < 0.5: forte disaccordo. AI Labs Audit contrassegna la dimensione come «contestata» nel PDF Premium e consiglia di ripetere l'audit o di dare priorità a quella dimensione nel piano d'azione.

Collegamento con gli Hero Grades

Il GRC è calcolato per ogni dimensione degli Hero Grade (citazioni, posizione, sentiment, copertura, autorità, percezione). Viene mostrato accanto all'intervallo di Wilson nella dashboard e nel PDF, consentendo ai consulenti GEO di difendere ogni punto con rigore davanti al cliente.

Nelle risposte AI, un brand appare solo 1 volta su 6. Il tuo compare?

Ogni domanda posta a ChatGPT senza il tuo nome nella risposta è un competitor raccomandato al posto tuo — misurato su 6.820 risposte AI reali.