El GRC (Generalized Reliability Coefficient) entre jueces es una métrica de coherencia entre los 5 LLM judges de AGS. Cuanto más cerca de 1, más coinciden los jueces; cuanto más cerca de 0, más debatida —y por tanto más frágil— es la puntuación final.
¿Por qué medir el acuerdo entre jueces?
El AGS moviliza a 5 LLM judges (Claude, GPT-4, Gemini, Llama, Mistral). Si los 5 coinciden, la puntuación final es sólida. Si 3 dan A y 2 dan F, la media será C, pero esa media oculta un desacuerdo que conviene señalar. Esa es la función del GRC.
¿Cómo se lee?
- GRC = 1,0: acuerdo perfecto. Los 5 jueces dan la misma puntuación.
- GRC ≥ 0,8: muy buen acuerdo. La puntuación es defendible tal cual.
- GRC entre 0,5 y 0,8: acuerdo moderado. La puntuación sigue siendo utilizable, pero el intervalo Wilson será más amplio.
- GRC < 0,5: desacuerdo fuerte. AI Labs Audit anota la dimensión como «en disputa» en el PDF Premium y recomienda relanzar una auditoría o priorizar esa dimensión en el plan de acción.
Vínculo con los Hero Grades
El GRC se calcula para cada dimensión del Hero Grade (citas, posición, sentimiento, cobertura, autoridad, percepción). Se muestra junto al intervalo Wilson en el dashboard y el PDF, permitiendo a los consultores GEO defender cada punto con rigor ante el cliente.
Cada pregunta hecha a ChatGPT sin el nombre de su cliente en la respuesta es un competidor recomendado en su lugar — medido sobre 6 820 respuestas reales de IA.