Wir veröffentlichen regelmäßig aggregierte, anonymisierte Zahlen aus unserer Plattform. Hier eine einfache Frage, die niemand mit echten Daten beantwortet: Wenn eine KI eine Quelle zitiert, existiert dieser Link wirklich? Und welches Modell irrt sich am häufigsten?
Der Geltungsbereich
Zwischen September 2025 und Juli 2026 hat die Plattform 7 774 KI-Antworten aus 132 Audits analysiert, erzeugt von 53 verschiedenen Modellen (ChatGPT, Claude, Gemini, Perplexity, Grok, Mistral und weitere). In diesen Antworten zitierten die Modelle 26 435 URLs als Quellen. Wir haben jede einzelne geprüft: 70 existierten nicht — plausible Links zu Seiten, die nie veröffentlicht wurden, verteilt auf 23 verschiedene Marken. Eine durchschnittliche Rate von 0,26 %, etwa 1 zitierte URL von 380.
Die Methode ist bewusst schwer anfechtbar: Eine URL zählt nur dann als „erfunden“, wenn das Modell sie als Quelle zitiert hat und sie zum Prüfzeitpunkt einen Fehler (404 oder Soft-404) zurückgibt. Keine Interpretation: Eine Seite existiert, oder sie existiert nicht.
Das Ranking — Erfundene-URL-Rate pro Modell
Die einzig ehrliche Zahl ist nicht die rohe Fehleranzahl, sondern die Rate: welcher Anteil der von einem Modell zitierten URLs nicht auflöst. Denn ein Modell, das viele Links zitiert (wie Perplexity), hat mechanisch mehr Gelegenheiten, sich zu irren. Hier also die erfundenen URLs im Verhältnis zu allen zitierten URLs, für jedes Modell mit ausreichender Datenbasis.
| Modell | Erfundene-URL-Rate | Erfundene URLs | Betroffene Marken | Zitierte URLs |
|---|---|---|---|---|
| Perplexity Sonar Pro | 1,05 % | 21 | 9 | 2 002 |
| Anthropic Claude Sonnet 4.6 | 0,62 % | 9 | 5 | 1 449 |
| OpenAI GPT-5 Mini | 0,44 % | 24 | 13 | 5 436 |
| Anthropic Claude Haiku 4.5 | 0,19 % | 8 | 3 | 4 198 |
| OpenAI GPT-5 | 0,16 % | 3 | 2 | 1 848 |
| Google Gemini 2.5 Flash | 0,12 % | 2 | 1 | 1 656 |
| Perplexity Sonar | 0,04 % | 3 | 3 | 7 065 |
So liest man es: Von den 2 002 URLs, die Perplexity Sonar Pro in unseren Audits zitierte, lösten 21 (1,05 %) nicht auf, verteilt auf 9 Marken. Modelle mit 3 erfundenen URLs oder weniger sind indikativ — die Stichprobe ist zu klein für ein feines Ranking, und das sagen wir auch.
Befund 1 — Das „Suchmaschinen“-Paradox
Das Modell, das anteilig die meisten URLs erfindet, ist Perplexity Sonar Pro — ausgerechnet jenes, das als Suchmaschine mit Quellenangaben verkauft wird. Doch die leichtere Version desselben Anbieters (Perplexity Sonar) erzielt den besten Wert des gesamten Panels (0,04 %). Der Abstand zwischen beiden beträgt rund das 25-Fache. Die Lehre: Die Zuverlässigkeit von Zitaten hängt nicht von der Marke des Modells ab, sondern von seiner genauen Konfiguration. Genau deshalb ist es sinnvoll, Modell für Modell zu messen — ein generisches „ChatGPT“ oder „Perplexity“ bedeutet nichts.
Befund 2 — Absolut betrachtet produziert das meistgenutzte Modell die meisten Fehler
GPT-5 Mini erzeugt die höchste absolute Zahl erfundener URLs (24, auf 13 Marken) — nicht weil es das unzuverlässigste wäre (seine Rate von 0,44 % liegt im Mittelfeld), sondern weil es das mit Abstand am häufigsten abgefragte Modell in unseren Audits ist. Anders gesagt: In großem Maßstab erzeugt selbst eine durchschnittliche Rate ein beträchtliches Fehlervolumen. Das ist die Falle der „Standard“-Modelle.
Befund 3 — Kein Modell ist immun
Jede Familie in unseren Daten — OpenAI, Anthropic, Google, Perplexity — produzierte mindestens eine erfundene URL. Es gibt kein „sauberes“ Modell bei 0 %. Und eine von einer zitierenden KI erfundene URL ist gefährlicher als ein einfacher Fehler: Der Nutzer vertraut der angezeigten Quelle. In unserem Barometer 2026 fanden wir 8 dieser Phantom-Adressen, die echte menschliche Besuche erhielten — Interessenten, die klicken und auf einer Fehlerseite landen, die Ihrer Marke zugeschrieben wird. Ein blinder Fleck der Reputation, ausführlich in unserem Leitfaden halluzinierte URLs und im Begriff KI-Halluzination.
Was es für eine Marke ändert
Zwei konkrete Erkenntnisse. Erstens: Das Modell, in dem Sie sichtbar sind, zählt ebenso wie die Sichtbarkeit selbst — eine Zitierung in einem Modell, das Links erfindet, setzt Sie falschen Assoziationen aus. Zweitens: Der einzige Weg, das zu wissen, ist die Messung pro Modell und die Prüfung jeder zitierten URL — was keine manuelle Überwachung in diesem Maßstab leisten kann.
Die Grenzen dieser Zahlen
Diese Daten stammen von Marken, die sich auditieren ließen — eine Stichprobe, die nicht repräsentativ für alle Unternehmen ist. Modelle mit geringem Fehlervolumen (3 URLs oder weniger) sind indikativ, nicht endgültig. Die Raten verändern sich mit jedem Modell-Update; wir werden diese Studie mit frischen Daten neu veröffentlichen. Die vollständige Methodik, einschließlich dessen, was wir nicht messen, steht auf unserer Methodik-Seite.
Sie möchten wissen, welche Modelle URLs für Ihre Marke zitieren — oder erfinden? Genau das misst ein Audit, Modell für Modell, URL für URL.
Jede Frage an ChatGPT ohne Ihren Namen in der Antwort ist ein Wettbewerber, der an Ihrer Stelle empfohlen wird — gemessen an 6 820 echten KI-Antworten.