El intervalo de confianza Wilson es una fórmula estadística adaptada a muestras binarias pequeñas (éxito/fracaso) que acota una puntuación observada entre un límite inferior y un límite superior. AI Labs Audit lo muestra en cada Hero Grade para indicar si la nota es estadísticamente sólida o todavía frágil.
¿Por qué no una media simple?
Imagine una marca citada 4 veces en 5 prompts (80 %) y otra citada 80 veces en 100 prompts (80 %). Ambas tienen la misma media, pero la segunda es mucho más fiable. El intervalo de confianza Wilson captura esa diferencia.
¿Cómo se lee?
Para cada Hero Grade, AI Labs Audit muestra por ejemplo:
Puntuación: 78 / 100
Intervalo Wilson 95 %: [71; 84]
Lectura: con un 95 % de confianza, la puntuación real se sitúa entre 71 y 84. Cuanto más estrecho sea el intervalo, más sólida es la nota. Un intervalo amplio indica que conviene relanzar una auditoría con más prompts o esperar más datos históricos.
¿Por qué Wilson y no Wald?
La fórmula clásica de Wald (media ± desviación típica) es numéricamente inestable cuando la puntuación se acerca al 0 % o al 100 % y la muestra es pequeña (típico en auditorías AEO/GEO de 12-24 prompts). Wilson se mantiene preciso en esas zonas y es la fórmula recomendada por los estándares estadísticos modernos (Brown, Cai y DasGupta, 2001).
Wilson y AGS
El AGS (Anti-Drift Grading System) calcula un Wilson en cada dimensión del Hero Grade y en cada respuesta evaluada. Esto permite detectar al instante las puntuaciones frágiles (intervalo > 15 puntos) y anotarlas en el PDF Premium para preservar la defendibilidad del informe.
Cada pregunta hecha a ChatGPT sin el nombre de su cliente en la respuesta es un competidor recomendado en su lugar — medido sobre 6 820 respuestas reales de IA.