Metodo & Trasparenza

Limiti noti & variabilità di misurazione

Misurare la visibilità di un brand nelle AI generative non è una scienza esatta: i modelli sono non-deterministici ed evolvono nel tempo. Invece di nascondere questa realtà dietro un punteggio "pulito", la documentiamo — e spieghiamo come il nostro metodo ne tiene conto.

1Le risposte AI variano da un'esecuzione all'altra

Lo stesso scenario può produrre risposte diverse a seconda del momento e della casualità del modello (la variabilità osservata è tipicamente nell'ordine del 15-20% su certe query).

La nostra risposta : Una giuria di diversi giudici, aggregazione robusta, e un intervallo di confidenza Wilson visualizzato — vedi il margine di incertezza, non solo una singola cifra.

2Ogni modello ha il proprio comportamento

I modelli non sono tutti uguali: alcuni citano più facilmente fonti tecniche, altri sono meno stabili su query locali, e altri variano a seconda della lingua.

La nostra risposta : Un audit multi-modello (diversi giudici, decine di modelli interrogati) con dettaglio per modello nel report, invece di un singolo voto complessivo che maschererebbe queste differenze.

3I punteggi si spostano quando i provider cambiano i loro modelli

Quando OpenAI, Google o Anthropic aggiornano un modello, le risposte — e quindi i punteggi — possono spostarsi senza che il brand abbia cambiato nulla.

La nostra risposta : L'anchor set (marchi di riferimento ri-misurati continuamente) isola questo model drift dalla performance effettiva del brand; il punteggio del cliente viene corretto di conseguenza.

4Una singola misurazione puntuale non basta

La visibilità AI è instabile nel tempo: una singola misurazione è fuorviante.

La nostra risposta : Audit programmati / ricorrenti e tracciamento dei trend — guardiamo all'evoluzione, non a un'istantanea.

5La quota "ricerca web" vs "memoria del modello"

Una risposta cambia a seconda che il modello abbia eseguito una ricerca web (retrieval) o risposto dalla sua memoria interna (parametrica).

La nostra risposta : Una diagnosi differenziale nativa vs web per distinguere le due e sapere quale leva azionare.

6I risultati dipendono da come è formulato lo scenario

Due modi di porre la stessa domanda possono produrre risposte diverse — e quindi punteggi diversi.

La nostra risposta : Scenari standardizzati, versionati e documentati (una tassonomia di scenari per intent); non improvvisiamo la domanda, applichiamo un protocollo riproducibile e seguiamo la stessa griglia nel tempo.

7Il contesto geografico e linguistico cambia la risposta

Un'AI può rispondere diversamente a seconda del paese (Francia, Belgio, Canada, Stati Uniti, ecc.) e della lingua.

La nostra risposta : Ogni audit è condotto in un contesto linguistico e geografico documentato (audit per lingua con contestualizzazione di mercato, competitor locali) — specifichiamo sempre in quale mercato è stata effettuata la misurazione, anziché un punteggio privo di contesto.

Cosa implica onestamente

L'AGS è una stima calibrata e riproducibile, non una verità assoluta. È progettato per essere comparabile nel tempo (stesso judge_config_hash) e onesto riguardo alla sua incertezza (intervalli di confidenza, GRC, drift corretto). Il nostro obiettivo non è una cifra lusinghiera, ma una misurazione che tu — e i tuoi clienti — possiate comprendere, verificare e contestare.

Misura la reale visibilità del tuo brand nelle risposte AI

Esegui un audit AGS e ottieni un punteggio verificabile, limiti dichiarati apertamente e un piano d'azione concreto.

Vedi i prezzi