Metodologia AGS — AI Grading System | AI Labs Audit
AGS (AI Grading System) è il motore di scoring di AI Labs Audit. Fa valutare ogni risposta AI da 5 giudici AI che si calibrano l'uno contro l'altro, poi pubblica un coefficiente di affidabilità inter-giudice così sai esattamente quanto è difendibile il tuo punteggio.
In 30 secondi
L'AGS (AI Grading System) è un metodo aperto per misurare la visibilità di un brand nelle risposte AI. Per ogni risposta, valutiamo tre cose — il brand è presente, ciò che viene detto è favorevole, e la risposta è affidabile — usando una giuria di diverse AI indipendenti. Il punteggio finale combina questi tre voti in modo che una debolezza non possa essere mascherata. Soprattutto, è un metodo: puoi comprenderlo, verificarlo e contestarlo.
Questo metodo può essere letto a diversi livelli: una definizione di 30 secondi, un diagramma, una spiegazione delle dimensioni, la formula, e infine l'appendice sulla riproducibilità. Un direttore marketing, un consulente GEO e un ricercatore dovrebbero tutti potersi orientare, ciascuno al livello di dettaglio che gli parla.
Il diagramma
+---------------------------------------------+
Scenario ---> | Risposta da un modello AI (ChatGPT, ecc.) |
+---------------------------------------------+
|
v
+---------------------------------------------+
| GIURIA = diversi giudici AI indipendenti |
| (provider diversi, anti self-pref.) |
+---------------------------------------------+
|
+--------------------------+--------------------------+
v v v
P - Presenza I - Influenza Q - Qualità
(M, RP, WC) (INF, UNQ, REL) (SENT, ACC)
+--------------------------+--------------------------+
v
AGS = (P x I x Q) ^ (1/3)
(media geometrica: uno zero su una
dimensione fa crollare il punteggio)
La media geometrica è deliberata: non puoi compensare un'assenza di presenza con un buon sentiment. Molto più difficile da gonfiare di una media convenzionale.
Cos'è AGS?
AGS è un protocollo di scoring multi-giudice open-source. Invece di affidarsi a un singolo LLM per valutare la visibilità del tuo brand (bias, allucinazioni, drift del modello), AGS interroga 5 giudici AI in parallelo (GPT-4o, Claude Sonnet, Gemini Pro, Mistral Large, Llama 3.1) e pubblica lo scarto tra loro. Più piccolo è lo scarto, più affidabile è il punteggio.
Le 3 dimensioni valutate
- P (Precision): la risposta menziona il tuo brand correttamente, senza confusione con un competitor o omonimo? Misura allucinazioni ed errori di attribuzione.
- I (Informativeness): la risposta fornisce informazioni utili e differenzianti sul tuo brand, o lo nomina soltanto? Misura la profondità della citazione.
- Q (Quality): la risposta è fattualmente corretta e aggiornata? Misura la freschezza delle informazioni e la conformità a fatti verificabili.
La formula (metodo pubblico, pesi proprietari)
AGS = (P x I x Q) ^ (1/3), ogni dimensione valutata da 0 a 100. Ogni dimensione è una combinazione ponderata di sotto-metriche:
- P — Presenza = una combinazione di Mention (M), Rank / Position (RP) e Coverage (WC).
- I — Influenza = una combinazione di Informativeness (INF), Uniqueness (UNQ) e Relevance (REL).
- Q — Qualità = una combinazione di Sentiment (SENT) e Accuracy (ACC).
I valori esatti dei pesi fanno parte della nostra metodologia proprietaria: sono normalizzati (somma = 1), calibrati e versionati, e tracciati dal judge_config_hash (che garantisce che due audit che condividono lo stesso hash siano strettamente comparabili). Pubblichiamo il metodo — struttura, media geometrica, dimensioni, sotto-metriche, giuria, affidabilità — senza divulgare i pesi esatti, che fanno parte del nostro know-how.
Giuria & riproducibilità
Ogni risposta è valutata da diversi modelli giudice di provider diversi per evitare che un modello favorisca se stesso. Alla data di pubblicazione, la giuria combina, ad esempio, modelli di OpenAI, Anthropic, Google, Mistral e DeepSeek — ma i modelli evolvono: questa lista è un esempio di oggi, non una promessa fissa.
La configurazione effettiva di ogni audit (modelli + pesi + rubriche) è tracciata dal suo judge_config_hash (SHA-256): quello è il riferimento stabile. Due audit che condividono lo stesso hash sono strettamente comparabili, e qualsiasi modifica alla giuria è tracciata.
- GRC: un coefficiente di affidabilità inter-giudice pubblicato per ogni audit (il grado di accordo tra i giudici).
- Un intervallo di confidenza Wilson è mostrato sui punteggi di presenza: l'incertezza è visualizzata, non solo una singola cifra.
- Anchor set: un panel di brand di riferimento ri-misurati continuamente rileva il drift del modello; il punteggio del cliente è corretto per questo drift.
Protocollo di valutazione
Per ogni scenario auditato, AGS esegue 5 chiamate parallele ai giudici AI con istruzioni identiche (scoring zero-shot). I punteggi sono aggregati tramite una media ponderata usando la confidenza dichiarata da ogni giudice. Il risultato finale include il punteggio medio, la deviazione standard inter-giudice e l'intervallo di confidenza bootstrap al 95%.
Coefficiente di affidabilità inter-giudice
AGS pubblica il coefficiente kappa di Fleiss (misura di accordo multi-valutatore) per ogni audit. Un kappa sopra 0.80 indica forte consenso tra i giudici (punteggio altamente affidabile). Tra 0.60 e 0.80: consenso moderato. Sotto 0.60: consenso debole — il punteggio va interpretato con cautela e la domanda riformulata.
Trasparenza e riproducibilità
Ogni audit AGS produce un hash crittografico degli scenari, delle risposte grezze e dei punteggi individuali. Questa firma prova che il punteggio non è stato manipolato. Il codice AGS è open source (licenza MIT) su github.com/sarsator/aqa-specification, e la formula di scoring è versionata e pubblicata. Qualsiasi cliente può verificare o contestare un punteggio.
Acronimi AGS
- GRC
- Generative Response Coverage: percentuale di scenari in cui almeno un giudice cita il brand.
- GIS
- Generative Inclusion Score: punteggio medio ponderato basato sulla posizione del brand nella risposta (primo menzionato = 100%, ultimo = 0%).
- ASR
- Answer Sentiment Rating: tonalità della menzione (positiva/neutra/negativa) su una scala da -1 a +1.
- BVI
- Brand Visibility Index: punteggio composito (GRC × GIS × ASR), da 0 a 100, che riassume la performance complessiva del brand attraverso le AI testate.
- CIA
- Citation Inter-judge Agreement: coefficiente kappa di Fleiss che misura l'accordo tra i 5 giudici AI sulla presenza di citazione.
30 Check GEO Avanzati 2026
Lo Sprint 15 ha consegnato 30 nuovi segnali GEO/AEO misurati passivamente (zero scraping che viola i ToS). Questi segnali completano lo scoring AGS attraverso la 6ª categoria 'advanced_signals' (peso composito 15%).
6 differenziatori di mercato
- A08 — Specificity score (Princeton GEO 2024) — Densità di statistiche con fonte tier-1 (Princeton GEO KDD 2024: +27 a +40% citazioni LLM).
- A09 — Marcatori di contro-argomentazioni — Nessun tool concorrente misura i marcatori di argomentazione bilanciata.
- A07 — Dichiarazioni datate
- S05 — Inclusione in Common Crawl
- S08 — Validazione RFC llms.txt
- B10 — Menzioni del brand su Stack Overflow
Modulo 6 — Segnali di Autorità Esterna
Nuovo modulo dedicato ai segnali di autorità esterna: LinkedIn, ProductHunt, G2/Capterra, Stack Overflow, GitHub, Substack/Medium.
Check per modulo GEO
- SSR / Crawlability
- mainEntity · QAPage · Trascrizioni video · Speakable · @graph @id · inLanguage · Common Crawl · llms.txt · IndexNow · ai.txt · Verifiche · HTTP/3 · Brotli
- Entity Health
- Wikidata · DBpedia
- Citation Readiness
- Statistiche con fonte · Argomentazione bilanciata · Datazione inline · ItemList · Dataset · Blockquote cite · Link interni · Entropia anchor · News Sitemap
- External Authority
- Stack Overflow · LinkedIn · GitHub · ProductHunt · Recensioni B2B · Newsletter
Tutti i check usano safe_external_call (retry + cache + circuit breaker) e memorizzano i risultati in audits.advanced_checks_v2 (JSONB + indice GIN).
Articolo completo sul blog: 30 nuovi segnali GEO/AEO 2026 — Stato dell'arte auditato.
Cosa misuriamo — e cosa non misuriamo
Cosa misuriamo
Interroghiamo i modelli AI attraverso le loro API ufficiali, in modalità nativa (la memoria del modello, senza browsing) e in modalità web (ricerca online abilitata), con domande riproducibili. Ogni audit calcola un'impronta crittografica della sua configurazione: due audit confrontati sono genuinamente comparabili.
Il panel predefinito è allineato con i prodotti che il pubblico usa realmente (ChatGPT, Gemini, Perplexity, Claude, Mistral…), e la dashboard mostra un punteggio di visibilità ponderato per la quota di audience reale di ciascun motore (fonti Statcounter / SimilarWeb, datate e riviste).
Cosa non misuriamo
Una risposta ottenuta tramite API può differire dall'interfaccia consumer dello stesso prodotto: memoria della conversazione, istruzioni proprietarie, geolocalizzazione o test A/B lato provider. Misuriamo il motore, non la sessione personalizzata di un utente loggato.
Le risposte AI sono probabilistiche: la stessa domanda può produrre varianti. Per questo misuriamo su decine di domande, con intervalli di confidenza (Wilson), piuttosto che su un singolo test.
Le quote di audience usate per la ponderazione sono stime di terze parti, datate e regolarmente riviste — non cifre interne non verificabili.
Perché documentare i nostri limiti? Perché una misurazione il cui perimetro è sconosciuto non vale nulla. È ciò che rende i nostri punteggi difendibili di fronte ai tuoi clienti.
Limiti & variabilità
Misurare la visibilità AI non è una scienza esatta. Documentiamo i nostri limiti e come il metodo ne tiene conto.
LeggiLa prova, passo dopo passo
Un esempio anonimizzato che mostra come una risposta AI diventa effettivamente un punteggio AGS.
LeggiGlossario termini tecnici
Approfondisci
Misura la reale visibilità del tuo brand nelle risposte AI
Esegui un audit AGS e ottieni un punteggio verificabile, limiti dichiarati apertamente e un piano d'azione concreto.
Vedi i prezzi