Méthodologie

Inter-Judge GRC (Generalized Reliability Coefficient)

Der Inter-Judge-GRC (Generalized Reliability Coefficient) ist eine Konsistenzmetrik zwischen den 5 LLM-Judges von AGS. Je näher an 1, desto mehr sind sich die Judges einig; je näher an 0, desto mehr ist die Endnote umstritten und somit fragil.

Warum die Übereinstimmung zwischen Judges messen?

Das AGS mobilisiert 5 LLM-Judges (Claude, GPT-4, Gemini, Llama, Mistral). Sind sich alle 5 einig, ist die Endnote solide. Geben 3 ein A und 2 ein F, ergibt der Mittelwert ein C — doch dieser Mittelwert verbirgt einen Dissens, den man sichtbar machen sollte. Genau dafür ist der GRC da.

So liest man ihn

  • GRC = 1,0: Perfekte Übereinstimmung. Alle 5 Judges geben dieselbe Note.
  • GRC ≥ 0,8: Sehr gute Übereinstimmung. Die Note ist so wie sie ist verteidigungsfähig.
  • GRC zwischen 0,5 und 0,8: Mittlere Übereinstimmung. Die Note bleibt nutzbar, das Wilson-Intervall wird jedoch breiter.
  • GRC < 0,5: Starker Dissens. AI Labs Audit markiert die Dimension im Premium-PDF als „strittig“ und empfiehlt, das Audit erneut zu starten oder diese Dimension im Aktionsplan zu priorisieren.

Verbindung zu Hero Grades

Der GRC wird für jede Dimension des Hero Grade (Citations, Position, Sentiment, Coverage, Authority, Perception) berechnet. Er erscheint neben dem Wilson-Intervall im Dashboard und PDF, sodass GEO-Berater jeden Punkt rigoros vor dem Kunden verteidigen können.

In KI-Antworten erscheint eine Marke nur 1 von 6 Mal. Und die Marken Ihrer Kunden?

Jede Frage an ChatGPT ohne den Namen Ihres Kunden in der Antwort ist ein Wettbewerber, der an seiner Stelle empfohlen wird — gemessen an 6 820 echten KI-Antworten.