Méthodologie AGS — AI Grading System | AI Labs Audit
AGS (AI Grading System) est le moteur de notation d’AI Labs Audit. Il fait évaluer les réponses IA par un pool de modèles évaluateurs indépendants qui se calibrent entre eux, puis publie un coefficient de fiabilité inter-évaluateurs pour que vous sachiez à quel point votre score est défendable.
En 30 secondes
L'AGS (AI Grading System) est une méthode ouverte de mesure de la visibilité d'une marque dans les réponses des IA. Pour chaque réponse, on note trois choses — la marque est-elle présente, ce qui est dit est-il valorisant, et la réponse est-elle fiable — via un jury de plusieurs IA indépendantes. Le score final combine ces trois notes de façon à ce qu'une faiblesse ne puisse pas être masquée. C'est avant tout une méthode : vous pouvez la comprendre, la vérifier et la contester.
Cette méthode se lit à plusieurs niveaux : une définition en 30 secondes, un schéma, l'explication des dimensions, la formule, puis l'annexe reproductibilité. Un directeur marketing, un consultant GEO et un chercheur doivent tous pouvoir s'y retrouver, chacun au niveau de détail qui lui parle.
Le schéma
+---------------------------------------------+
Scénario ---> | Réponse d'un modèle d'IA (ChatGPT, etc.) |
+---------------------------------------------+
|
v
+---------------------------------------------+
| JURY = plusieurs IA juges indépendantes |
| (fournisseurs différents, anti auto-préf.)|
+---------------------------------------------+
|
+--------------------------+--------------------------+
v v v
P - Présence I - Influence Q - Qualité
(M, RP, WC) (INF, UNQ, REL) (SENT, ACC)
+--------------------------+--------------------------+
v
AGS = (P x I x Q) ^ (1/3)
(moyenne géométrique : un zéro sur
une dimension effondre le score)
La moyenne géométrique est volontaire : impossible de compenser une absence de présence par un bon sentiment. Beaucoup plus difficile à gonfler qu'une moyenne classique.
Qu’est-ce qu’AGS ?
AGS est un protocole de scoring multi-modèles open source. Au lieu d’utiliser un seul LLM pour évaluer la visibilité de votre marque (biais, hallucinations, dérive du modèle), AGS répartit les évaluations sur un pool de modèles issus de fournisseurs différents et publie l’écart entre eux. Plus l’écart est faible, plus le score est fiable.
Les 3 dimensions évaluées
- P (Précision) : la réponse cite-t-elle votre marque correctement, sans confondre avec un concurrent ou un homonyme ? Mesure les hallucinations et les fautes d’attribution.
- I (Informativité) : la réponse fournit-elle des informations utiles et différenciantes sur votre marque, ou se contente-t-elle de la nommer ? Mesure la profondeur de la citation.
- Q (Qualité) : la réponse est-elle factuellement correcte et à jour ? Mesure la fraîcheur de l’information et la conformité aux faits vérifiables.
La formule (méthode publique, pondérations propriétaires)
AGS = (P x I x Q) ^ (1/3), chaque dimension notée de 0 à 100. Chaque dimension est une combinaison pondérée de sous-métriques :
- P — Présence = combinaison de la Mention (M), du Rang / Position (RP) et de la Couverture (WC).
- I — Influence = combinaison de l'Informativité (INF), de l'Unicité (UNQ) et de la Pertinence (REL).
- Q — Qualité = combinaison du Sentiment (SENT) et de l'Exactitude (ACC).
Les valeurs exactes des pondérations font partie de notre méthodologie propriétaire : elles sont normalisées (somme = 1), calibrées et versionnées, et tracées par le judge_config_hash (qui garantit que deux audits au même hash sont strictement comparables). Nous publions la méthode — structure, moyenne géométrique, dimensions, sous-métriques, jury, fiabilité — sans divulguer la pondération exacte, qui relève de notre savoir-faire.
Jury & reproductibilité
Chaque réponse est notée par plusieurs modèles juges de fournisseurs différents pour éviter qu'un modèle se préfère lui-même. À la date de publication, le jury combine par exemple des modèles d'OpenAI, Anthropic, Google, Mistral et DeepSeek — mais les modèles évoluent : cette liste est un exemple à date, pas une promesse figée.
La configuration réelle de chaque audit (modèles + poids + rubriques) est tracée par son judge_config_hash (SHA-256) : c'est lui la référence stable. Deux audits au même hash sont strictement comparables, et tout changement de jury est tracé.
- GRC : coefficient de fiabilité inter-juges publié pour chaque audit (degré d'accord entre les juges).
- Intervalle de confiance affiché sur les scores de présence : l'incertitude est montrée, pas seulement un chiffre.
- Anchor set : un panel de marques témoins re-mesuré en continu détecte la dérive des modèles ; le score client est corrigé de cette dérive.
Protocole d’évaluation
Pour chaque scénario audité, AGS envoie aux modèles évaluateurs des instructions identiques (zero-shot scoring). Les évaluations sont réparties en rotation sur le pool, une part d’entre elles étant doublée pour mesurer l’accord entre évaluateurs. Les scores sont ensuite agrégés et calibrés. Le résultat final inclut le score moyen, l’écart entre évaluateurs et l’intervalle de confiance bootstrap à 95 %.
Coefficient de fiabilité inter-juges
AGS publie le coefficient kappa de Fleiss (mesure d’accord entre plusieurs évaluateurs) pour chaque audit. Un kappa supérieur à 0,80 indique un consensus fort entre les juges (score très fiable). Entre 0,60 et 0,80 : consensus modéré. En dessous de 0,60 : consensus faible — le score doit être interprété avec prudence et la question reformulée.
Transparence et reproductibilité
Chaque audit AGS produit un hash cryptographique des scénarios, des réponses brutes et des scores individuels. Ce signature permet de prouver que le score n’a pas été manipulé. Le code AGS est open source (licence MIT) sur github.com/sarsator/aqa-specification, et la formule de scoring est versionnée et publiée. Tout client peut vérifier ou contester un score.
Acronymes AGS
- GRC
- Generative Response Coverage : pourcentage de scénarios pour lesquels au moins un juge cite la marque.
- GIS
- Generative Inclusion Score : score moyen pondéré par la position de la marque dans la réponse (premier mentionné = 100%, dernier = 0%).
- ASR
- Answer Sentiment Rating : tonalité de la mention (positif/neutre/négatif) sur une échelle de -1 à +1.
- BVI
- Brand Visibility Index : score composite (GRC × GIS × ASR), de 0 à 100, qui résume la performance globale de la marque sur les IA testées.
- CIA
- Citation Inter-judge Agreement : coefficient kappa de Fleiss mesurant l’accord entre les modèles évaluateurs sur la présence de la citation.
30 Advanced Checks GEO 2026
Sprint 15 a livré 30 nouveaux signaux GEO/AEO mesurés en passif (zéro scraping ToS-violant). Ces signaux complètent le scoring AGS via la 6e catégorie « advanced_signals » (poids 15 % du composite).
6 différenciateurs marché
- A08 — Specificity score (Princeton GEO 2024) — Densité de statistiques sourcées tier-1 (Princeton GEO KDD 2024 : +27 à +40 % de citations LLM).
- A09 — Counter-arguments markers — Aucun outil concurrent ne mesure les marqueurs d’argumentation équilibrée.
- A07 — Date-stamped statements
- S05 — Common Crawl inclusion
- S08 — llms.txt RFC validation
- B10 — Stack Overflow brand mentions
Module 6 — External Authority Signals
Nouveau module dédié aux signaux d’autorité externes : LinkedIn, ProductHunt, G2/Capterra, Stack Overflow, GitHub, Substack/Medium.
Checks par module GEO
- SSR / Crawlabilité
- mainEntity · QAPage · Transcripts vidéo · Speakable · @graph @id · inLanguage · Common Crawl · llms.txt · IndexNow · ai.txt · Verifications · HTTP/3 · Brotli
- Entity Health
- Wikidata · DBpedia
- Citation Readiness
- Stats sourcées · Argumentation · Datage inline · ItemList · Dataset · Blockquote cite · Liens internes · Anchor entropy · Sitemap News
- External Authority
- Stack Overflow · LinkedIn · GitHub · ProductHunt · B2B reviews · Newsletter
Tous les checks utilisent safe_external_call (retry + cache + circuit breaker) et stockent leurs résultats dans audits.advanced_checks_v2 (JSONB + index GIN).
Article complet sur le blog : 30 nouveaux signaux GEO/AEO 2026 — État de l’art audité.
Ce que nous mesurons — et ce que nous ne mesurons pas
Ce que nous mesurons
Nous interrogeons les modèles d'IA via leurs API officielles, en mode natif (la mémoire du modèle, sans navigation) et en mode web (recherche en ligne activée), avec des questions reproductibles. Chaque audit calcule une empreinte cryptographique de sa configuration : deux audits comparés sont réellement comparables.
Le panel par défaut est aligné sur les produits que le public utilise réellement (ChatGPT, Gemini, Perplexity, Claude, Mistral…), et le tableau de bord affiche une visibilité pondérée par la part d'audience réelle de chaque moteur (sources Statcounter / SimilarWeb, datées et révisées).
Ce que nous ne mesurons pas
Une réponse obtenue par API peut différer de l'interface grand public du même produit : mémoire de conversation, instructions propriétaires, géolocalisation ou tests A/B de l'éditeur. Nous mesurons le moteur, pas la session personnalisée d'un utilisateur connecté.
Les réponses des IA sont probabilistes : la même question peut produire des variantes. C'est pourquoi nous mesurons sur des dizaines de questions, avec des intervalles de confiance, plutôt que sur un test unique.
Les parts d'audience utilisées pour la pondération sont des estimations tierces, datées, et révisées régulièrement — pas des chiffres internes invérifiables.
Pourquoi documenter nos limites ? Parce qu'une mesure dont on ne connaît pas le périmètre ne vaut rien. C'est la condition pour que nos scores soient défendables devant vos clients.
Limites & variabilité
Mesurer la visibilité IA n'est pas une science exacte. Nous documentons nos limites et comment la méthode les prend en compte.
LireLa preuve, étape par étape
Un exemple anonymisé qui montre comment une réponse d'IA devient réellement un score AGS.
LireGlossaire des termes techniques
Pour aller plus loin
Mesurez la visibilité réelle de votre marque dans les IA
Lancez un audit AGS et obtenez un score auditable, des limites assumées et un plan d'action concret.
Découvrir les tarifs