¿Qué modelo de IA inventa más URLs? 26 435 citas analizadas

Publicamos regularmente cifras agregadas y anónimas procedentes de nuestra plataforma. Aquí, una pregunta simple que nadie responde con datos reales: cuando una IA cita una fuente, ¿ese enlace existe de verdad? ¿Y qué modelo se equivoca más?

El perímetro

Entre septiembre de 2025 y julio de 2026, la plataforma analizó 7 774 respuestas de IA procedentes de 132 auditorías, producidas por 53 modelos distintos (ChatGPT, Claude, Gemini, Perplexity, Grok, Mistral y otros). En esas respuestas, los modelos citaron 26 435 URLs como fuentes. Las verificamos una a una: 70 no existían — enlaces plausibles hacia páginas que nunca se publicaron, repartidos en 23 marcas diferentes. Una tasa media del 0,26 %, aproximadamente 1 URL citada de cada 380.

El método es deliberadamente difícil de discutir: una URL se cuenta como «inventada» solo si el modelo la citó como fuente y devuelve un error (404 o soft-404) en el momento de la verificación. Sin interpretación: una página existe, o no existe.

El ranking — tasa de URLs inventadas por modelo

La única cifra honesta no es el número bruto de errores, sino la tasa: qué proporción de las URLs que cita un modelo no resuelve. Porque un modelo que cita muchos enlaces (como Perplexity) tiene mecánicamente más ocasiones de equivocarse. Estas son las URLs inventadas en relación con el total de URLs citadas, para cada modelo con datos suficientes.

ModeloTasa de URLs inventadasURLs inventadasMarcas afectadasURLs citadas
Perplexity Sonar Pro1,05 %2192 002
Anthropic Claude Sonnet 4.60,62 %951 449
OpenAI GPT-5 Mini0,44 %24135 436
Anthropic Claude Haiku 4.50,19 %834 198
OpenAI GPT-50,16 %321 848
Google Gemini 2.5 Flash0,12 %211 656
Perplexity Sonar0,04 %337 065

Cómo leerlo: de las 2 002 URLs citadas por Perplexity Sonar Pro en nuestras auditorías, 21 (1,05 %) no resolvían, en 9 marcas. Los modelos con 3 URLs inventadas o menos son indicativos — la muestra es demasiado pequeña para un ranking fino, y lo decimos.

Constatación 1 — La paradoja del «motor de búsqueda»

El modelo que más URLs inventa, en proporción, es Perplexity Sonar Pro — precisamente el que se vende como un motor de búsqueda que cita sus fuentes. Sin embargo, la versión más ligera del mismo proveedor (Perplexity Sonar) obtiene la mejor puntuación de todo el panel (0,04 %). La diferencia entre ambos es de unas 25 veces. La lección: la fiabilidad de las citas no depende de la marca del modelo, sino de su configuración precisa. Por eso medir modelo por modelo tiene sentido — un «ChatGPT» o un «Perplexity» genérico no significa nada.

Constatación 2 — En absoluto, el más usado produce más errores

GPT-5 Mini genera el mayor número de URLs inventadas en valor bruto (24, en 13 marcas) — no porque sea el menos fiable (su tasa, 0,44 %, está en el medio del ranking), sino porque es con diferencia el modelo más solicitado en nuestras auditorías. Dicho de otro modo: a gran escala, incluso una tasa media produce un volumen de errores considerable. Es la trampa de los modelos «por defecto».

Constatación 3 — Ningún modelo es inmune

Cada familia presente en nuestros datos — OpenAI, Anthropic, Google, Perplexity — produjo al menos una URL inventada. No existe un modelo «limpio» al 0 %. Y una URL inventada por una IA de citación es más peligrosa que un simple error: el usuario confía en la fuente mostrada. En nuestro barómetro 2026 detectamos 8 de esas direcciones fantasma que recibieron visitas humanas reales — prospectos que hacen clic y caen en una página de error atribuida a su marca. Es un punto ciego de la reputación, detallado en nuestra guía URLs alucinadas y el término alucinación de IA.

Lo que cambia para una marca

Dos conclusiones concretas. Primero, el modelo en el que es visible importa tanto como el hecho de ser visible: una cita en un modelo que inventa enlaces le expone a asociaciones erróneas. Segundo, la única forma de saberlo es medir por modelo y verificar cada URL citada — algo que ninguna vigilancia manual permite a esta escala.

Los límites de estas cifras

Estos datos provienen de marcas que decidieron auditarse — una muestra no representativa de todas las empresas. Los modelos con bajo volumen de errores (3 URLs o menos) son indicativos, no definitivos. Las tasas evolucionan con cada actualización de los modelos; volveremos a publicar este estudio con datos frescos. La metodología completa, incluido lo que no medimos, está en nuestra página de metodología.

¿Quiere saber qué modelos citan — o inventan — URLs para su marca? Es exactamente lo que mide una auditoría, modelo por modelo, URL por URL.

Sobre el autor

Davy Abderrahman

Fundador & CEO en

Especialista en visibilidad IA (AEO/GEO/LLMO), ayudo a agencias y consultores a medir y optimizar la presencia de sus clientes en ChatGPT, Claude, Gemini, Perplexity y otros motores de respuesta IA. Pionero en auditorías de visibilidad IA desde 2024.

AEO GEO LLMO Visibilidad IA Auditorías IA
En las respuestas de las IA, una marca aparece solo 1 de cada 6 veces. ¿Y la suya?

Cada pregunta hecha a ChatGPT sin su nombre en la respuesta es un competidor recomendado en su lugar — medido sobre 6 820 respuestas reales de IA.

¿Te ha sido útil este artículo?

- (0 votes)