Metodologia AGS — AI Grading System | AI Labs Audit
AGS (AI Grading System) è il motore di scoring di AI Labs Audit. Fa valutare le risposte IA da un pool di modelli valutatori indipendenti che si calibrano tra loro, poi pubblica un coefficiente di affidabilità tra valutatori per farti sapere quanto il tuo punteggio sia difendibile.
In 30 secondi
L'AGS (AI Grading System) è un metodo aperto per misurare la visibilità di un brand nelle risposte AI. Per ogni risposta, valutiamo tre cose — il brand è presente, ciò che viene detto è favorevole, e la risposta è affidabile — usando una giuria di diverse AI indipendenti. Il punteggio finale combina questi tre voti in modo che una debolezza non possa essere mascherata. Soprattutto, è un metodo: puoi comprenderlo, verificarlo e contestarlo.
Questo metodo può essere letto a diversi livelli: una definizione di 30 secondi, un diagramma, una spiegazione delle dimensioni, la formula, e infine l'appendice sulla riproducibilità. Un direttore marketing, un consulente GEO e un ricercatore dovrebbero tutti potersi orientare, ciascuno al livello di dettaglio che gli parla.
Il diagramma
+---------------------------------------------+
Scenario ---> | Risposta da un modello AI (ChatGPT, ecc.) |
+---------------------------------------------+
|
v
+---------------------------------------------+
| GIURIA = diversi giudici AI indipendenti |
| (provider diversi, anti self-pref.) |
+---------------------------------------------+
|
+--------------------------+--------------------------+
v v v
P - Presenza I - Influenza Q - Qualità
(M, RP, WC) (INF, UNQ, REL) (SENT, ACC)
+--------------------------+--------------------------+
v
AGS = (P x I x Q) ^ (1/3)
(media geometrica: uno zero su una
dimensione fa crollare il punteggio)
La media geometrica è deliberata: non puoi compensare un'assenza di presenza con un buon sentiment. Molto più difficile da gonfiare di una media convenzionale.
Cos'è AGS?
AGS è un protocollo di scoring multi-modello open-source. Invece di affidarsi a un singolo LLM per valutare la visibilità del tuo brand (bias, allucinazioni, drift del modello), AGS distribuisce le valutazioni su un pool di modelli di fornitori diversi e pubblica lo scarto tra loro. Più lo scarto è ridotto, più il punteggio è affidabile.
Le 3 dimensioni valutate
- P (Precision): la risposta menziona il tuo brand correttamente, senza confusione con un competitor o omonimo? Misura allucinazioni ed errori di attribuzione.
- I (Informativeness): la risposta fornisce informazioni utili e differenzianti sul tuo brand, o lo nomina soltanto? Misura la profondità della citazione.
- Q (Quality): la risposta è fattualmente corretta e aggiornata? Misura la freschezza delle informazioni e la conformità a fatti verificabili.
La formula (metodo pubblico, pesi proprietari)
AGS = (P x I x Q) ^ (1/3), ogni dimensione valutata da 0 a 100. Ogni dimensione è una combinazione ponderata di sotto-metriche:
- P — Presenza = una combinazione di Mention (M), Rank / Position (RP) e Coverage (WC).
- I — Influenza = una combinazione di Informativeness (INF), Uniqueness (UNQ) e Relevance (REL).
- Q — Qualità = una combinazione di Sentiment (SENT) e Accuracy (ACC).
I valori esatti dei pesi fanno parte della nostra metodologia proprietaria: sono normalizzati (somma = 1), calibrati e versionati, e tracciati dal judge_config_hash (che garantisce che due audit che condividono lo stesso hash siano strettamente comparabili). Pubblichiamo il metodo — struttura, media geometrica, dimensioni, sotto-metriche, giuria, affidabilità — senza divulgare i pesi esatti, che fanno parte del nostro know-how.
Giuria & riproducibilità
Ogni risposta è valutata da diversi modelli giudice di provider diversi per evitare che un modello favorisca se stesso. Alla data di pubblicazione, la giuria combina, ad esempio, modelli di OpenAI, Anthropic, Google, Mistral e DeepSeek — ma i modelli evolvono: questa lista è un esempio di oggi, non una promessa fissa.
La configurazione effettiva di ogni audit (modelli + pesi + rubriche) è tracciata dal suo judge_config_hash (SHA-256): quello è il riferimento stabile. Due audit che condividono lo stesso hash sono strettamente comparabili, e qualsiasi modifica alla giuria è tracciata.
- GRC: un coefficiente di affidabilità inter-giudice pubblicato per ogni audit (il grado di accordo tra i giudici).
- Intervallo di confidenza mostrato sui punteggi di presenza: l'incertezza è visibile, non solo un numero.
- Anchor set: un panel di brand di riferimento ri-misurati continuamente rileva il drift del modello; il punteggio del cliente è corretto per questo drift.
Protocollo di valutazione
Per ogni scenario auditato, AGS invia ai modelli valutatori istruzioni identiche (scoring zero-shot). Le valutazioni sono distribuite a rotazione sul pool, con una quota duplicata per misurare l'accordo tra valutatori. I punteggi vengono poi aggregati e calibrati. Il risultato finale include il punteggio medio, lo scarto tra valutatori e l'intervallo di confidenza bootstrap al 95 %.
Coefficiente di affidabilità inter-giudice
AGS pubblica il coefficiente kappa di Fleiss (misura di accordo multi-valutatore) per ogni audit. Un kappa sopra 0.80 indica forte consenso tra i giudici (punteggio altamente affidabile). Tra 0.60 e 0.80: consenso moderato. Sotto 0.60: consenso debole — il punteggio va interpretato con cautela e la domanda riformulata.
Trasparenza e riproducibilità
Ogni audit AGS produce un hash crittografico degli scenari, delle risposte grezze e dei punteggi individuali. Questa firma prova che il punteggio non è stato manipolato. Il codice AGS è open source (licenza MIT) su github.com/sarsator/aqa-specification, e la formula di scoring è versionata e pubblicata. Qualsiasi cliente può verificare o contestare un punteggio.
Acronimi AGS
- GRC
- Generative Response Coverage: percentuale di scenari in cui almeno un giudice cita il brand.
- GIS
- Generative Inclusion Score: punteggio medio ponderato basato sulla posizione del brand nella risposta (primo menzionato = 100%, ultimo = 0%).
- ASR
- Answer Sentiment Rating: tonalità della menzione (positiva/neutra/negativa) su una scala da -1 a +1.
- BVI
- Brand Visibility Index: punteggio composito (GRC × GIS × ASR), da 0 a 100, che riassume la performance complessiva del brand attraverso le AI testate.
- CIA
- Citation Inter-judge Agreement: coefficiente kappa di Fleiss che misura l'accordo tra i modelli valutatori sulla presenza di citazione.
30 Check GEO Avanzati 2026
Lo Sprint 15 ha consegnato 30 nuovi segnali GEO/AEO misurati passivamente (zero scraping che viola i ToS). Questi segnali completano lo scoring AGS attraverso la 6ª categoria 'advanced_signals' (peso composito 15%).
6 differenziatori di mercato
- A08 — Specificity score (Princeton GEO 2024) — Densità di statistiche con fonte tier-1 (Princeton GEO KDD 2024: +27 a +40% citazioni LLM).
- A09 — Marcatori di contro-argomentazioni — Nessun tool concorrente misura i marcatori di argomentazione bilanciata.
- A07 — Dichiarazioni datate
- S05 — Inclusione in Common Crawl
- S08 — Validazione RFC llms.txt
- B10 — Menzioni del brand su Stack Overflow
Modulo 6 — Segnali di Autorità Esterna
Nuovo modulo dedicato ai segnali di autorità esterna: LinkedIn, ProductHunt, G2/Capterra, Stack Overflow, GitHub, Substack/Medium.
Check per modulo GEO
- SSR / Crawlability
- mainEntity · QAPage · Trascrizioni video · Speakable · @graph @id · inLanguage · Common Crawl · llms.txt · IndexNow · ai.txt · Verifiche · HTTP/3 · Brotli
- Entity Health
- Wikidata · DBpedia
- Citation Readiness
- Statistiche con fonte · Argomentazione bilanciata · Datazione inline · ItemList · Dataset · Blockquote cite · Link interni · Entropia anchor · News Sitemap
- External Authority
- Stack Overflow · LinkedIn · GitHub · ProductHunt · Recensioni B2B · Newsletter
Tutti i check usano safe_external_call (retry + cache + circuit breaker) e memorizzano i risultati in audits.advanced_checks_v2 (JSONB + indice GIN).
Articolo completo sul blog: 30 nuovi segnali GEO/AEO 2026 — Stato dell'arte auditato.
Cosa misuriamo — e cosa non misuriamo
Cosa misuriamo
Interroghiamo i modelli AI attraverso le loro API ufficiali, in modalità nativa (la memoria del modello, senza browsing) e in modalità web (ricerca online abilitata), con domande riproducibili. Ogni audit calcola un'impronta crittografica della sua configurazione: due audit confrontati sono genuinamente comparabili.
Il panel predefinito è allineato con i prodotti che il pubblico usa realmente (ChatGPT, Gemini, Perplexity, Claude, Mistral…), e la dashboard mostra un punteggio di visibilità ponderato per la quota di audience reale di ciascun motore (fonti Statcounter / SimilarWeb, datate e riviste).
Cosa non misuriamo
Una risposta ottenuta tramite API può differire dall'interfaccia consumer dello stesso prodotto: memoria della conversazione, istruzioni proprietarie, geolocalizzazione o test A/B lato provider. Misuriamo il motore, non la sessione personalizzata di un utente loggato.
Le risposte delle IA sono probabilistiche: la stessa domanda può produrre varianti. Per questo misuriamo su decine di domande, con intervalli di confidenza, invece che su un test singolo.
Le quote di audience usate per la ponderazione sono stime di terze parti, datate e regolarmente riviste — non cifre interne non verificabili.
Perché documentare i nostri limiti? Perché una misurazione il cui perimetro è sconosciuto non vale nulla. È ciò che rende i nostri punteggi difendibili di fronte ai tuoi clienti.
Limiti & variabilità
Misurare la visibilità AI non è una scienza esatta. Documentiamo i nostri limiti e come il metodo ne tiene conto.
LeggiLa prova, passo dopo passo
Un esempio anonimizzato che mostra come una risposta AI diventa effettivamente un punteggio AGS.
LeggiGlossario termini tecnici
Approfondisci
Misura la reale visibilità del tuo brand nelle risposte AI
Esegui un audit AGS e ottieni un punteggio verificabile, limiti dichiarati apertamente e un piano d'azione concreto.
Vedi i prezzi