Publicamos regularmente cifras agregadas y anónimas procedentes de nuestra plataforma. Aquí, una pregunta simple que nadie responde con datos reales: cuando una IA cita una fuente, ¿ese enlace existe de verdad? ¿Y qué modelo se equivoca más?
El perímetro
Entre septiembre de 2025 y julio de 2026, la plataforma analizó 7 774 respuestas de IA procedentes de 132 auditorías, producidas por 53 modelos distintos (ChatGPT, Claude, Gemini, Perplexity, Grok, Mistral y otros). En esas respuestas, los modelos citaron 26 435 URLs como fuentes. Las verificamos una a una: 70 no existían — enlaces plausibles hacia páginas que nunca se publicaron, repartidos en 23 marcas diferentes. Una tasa media del 0,26 %, aproximadamente 1 URL citada de cada 380.
El método es deliberadamente difícil de discutir: una URL se cuenta como «inventada» solo si el modelo la citó como fuente y devuelve un error (404 o soft-404) en el momento de la verificación. Sin interpretación: una página existe, o no existe.
El ranking — tasa de URLs inventadas por modelo
La única cifra honesta no es el número bruto de errores, sino la tasa: qué proporción de las URLs que cita un modelo no resuelve. Porque un modelo que cita muchos enlaces (como Perplexity) tiene mecánicamente más ocasiones de equivocarse. Estas son las URLs inventadas en relación con el total de URLs citadas, para cada modelo con datos suficientes.
| Modelo | Tasa de URLs inventadas | URLs inventadas | Marcas afectadas | URLs citadas |
|---|---|---|---|---|
| Perplexity Sonar Pro | 1,05 % | 21 | 9 | 2 002 |
| Anthropic Claude Sonnet 4.6 | 0,62 % | 9 | 5 | 1 449 |
| OpenAI GPT-5 Mini | 0,44 % | 24 | 13 | 5 436 |
| Anthropic Claude Haiku 4.5 | 0,19 % | 8 | 3 | 4 198 |
| OpenAI GPT-5 | 0,16 % | 3 | 2 | 1 848 |
| Google Gemini 2.5 Flash | 0,12 % | 2 | 1 | 1 656 |
| Perplexity Sonar | 0,04 % | 3 | 3 | 7 065 |
Cómo leerlo: de las 2 002 URLs citadas por Perplexity Sonar Pro en nuestras auditorías, 21 (1,05 %) no resolvían, en 9 marcas. Los modelos con 3 URLs inventadas o menos son indicativos — la muestra es demasiado pequeña para un ranking fino, y lo decimos.
Constatación 1 — La paradoja del «motor de búsqueda»
El modelo que más URLs inventa, en proporción, es Perplexity Sonar Pro — precisamente el que se vende como un motor de búsqueda que cita sus fuentes. Sin embargo, la versión más ligera del mismo proveedor (Perplexity Sonar) obtiene la mejor puntuación de todo el panel (0,04 %). La diferencia entre ambos es de unas 25 veces. La lección: la fiabilidad de las citas no depende de la marca del modelo, sino de su configuración precisa. Por eso medir modelo por modelo tiene sentido — un «ChatGPT» o un «Perplexity» genérico no significa nada.
Constatación 2 — En absoluto, el más usado produce más errores
GPT-5 Mini genera el mayor número de URLs inventadas en valor bruto (24, en 13 marcas) — no porque sea el menos fiable (su tasa, 0,44 %, está en el medio del ranking), sino porque es con diferencia el modelo más solicitado en nuestras auditorías. Dicho de otro modo: a gran escala, incluso una tasa media produce un volumen de errores considerable. Es la trampa de los modelos «por defecto».
Constatación 3 — Ningún modelo es inmune
Cada familia presente en nuestros datos — OpenAI, Anthropic, Google, Perplexity — produjo al menos una URL inventada. No existe un modelo «limpio» al 0 %. Y una URL inventada por una IA de citación es más peligrosa que un simple error: el usuario confía en la fuente mostrada. En nuestro barómetro 2026 detectamos 8 de esas direcciones fantasma que recibieron visitas humanas reales — prospectos que hacen clic y caen en una página de error atribuida a su marca. Es un punto ciego de la reputación, detallado en nuestra guía URLs alucinadas y el término alucinación de IA.
Lo que cambia para una marca
Dos conclusiones concretas. Primero, el modelo en el que es visible importa tanto como el hecho de ser visible: una cita en un modelo que inventa enlaces le expone a asociaciones erróneas. Segundo, la única forma de saberlo es medir por modelo y verificar cada URL citada — algo que ninguna vigilancia manual permite a esta escala.
Los límites de estas cifras
Estos datos provienen de marcas que decidieron auditarse — una muestra no representativa de todas las empresas. Los modelos con bajo volumen de errores (3 URLs o menos) son indicativos, no definitivos. Las tasas evolucionan con cada actualización de los modelos; volveremos a publicar este estudio con datos frescos. La metodología completa, incluido lo que no medimos, está en nuestra página de metodología.
¿Quiere saber qué modelos citan — o inventan — URLs para su marca? Es exactamente lo que mide una auditoría, modelo por modelo, URL por URL.
Cada pregunta hecha a ChatGPT sin su nombre en la respuesta es un competidor recomendado en su lugar — medido sobre 6 820 respuestas reales de IA.