134 respuestas erróneas de 200, 15 dudas expresadas: ser citado no es ser bien citado
Dos grandes estudios midieron las citas de los motores de IA. Más del 60 % son incorrectas, el 31 % tiene un problema de fuente, y la seguridad nunca baja. Lo que cambia para una marca.
más del 60 %
de las citas incorrectas en 1 600 consultas, ocho motores probados (Tow Center, marzo de 2025)
En este artículo
Respuesta corta: una cita de IA puede nombrarle y equivocarse sobre usted. Las mediciones publicadas no tratan de aparecer, sino de la exactitud de lo que se atribuye: más del 60 % de citas incorrectas en un estudio de 1 600 consultas, un 31 % con problemas de fuente en otro sobre más de 3 000 respuestas. La pregunta útil no es solo « ¿me citan? », sino « ¿lo que me hacen decir es cierto, y el enlace lleva a alguna parte? ».
31 %
de las respuestas con problema de fuente: atribución ausente, engañosa o falsa (EBU y BBC, octubre de 2025)
134 frente a 15
artículos mal identificados por ChatGPT, frente al número de veces que señaló una duda, sobre 200 respuestas
Un motor que se equivoca y lo dice le deja una oportunidad. Un motor que se equivoca con aplomo no la deja: el lector no tiene motivo para ir a verificar.
Lo que midieron dos grandes estudios
El primero procede del Tow Center for Digital Journalism, en Columbia, publicado el 6 de marzo de 2025. El protocolo es simple y reproducible: veinte editores, diez artículos tomados al azar de cada uno, extractos copiados tal cual, y ocho motores de respuesta a los que se pide identificar el titular, el editor de origen, la fecha y la URL. Son 1 600 consultas. En conjunto, los motores dieron una respuesta incorrecta a más del 60 % de ellas.
| Medición | Resultado |
|---|---|
| Conjunto de los ocho motores | más del 60 % de respuestas incorrectas |
| Perplexity, el mejor del panel | 37 % incorrectas |
| Grok-3, el peor del panel | 94 % incorrectas |
| Grok-3, citas que llevan a una página de error | 154 de 200 |
El segundo es más amplio y viene de los medios de servicio público. Publicado el 22 de octubre de 2025 por la Unión Europea de Radiodifusión con la BBC, hizo que periodistas profesionales evaluaran más de 3 000 respuestas de ChatGPT, Copilot, Gemini y Perplexity, en 22 organizaciones, 18 países y 14 lenguas. Su conclusión central es que el fallo es sistémico: no depende de la lengua, ni del mercado, ni de un asistente concreto.
| Tipo de defecto | Porcentaje de las respuestas |
|---|---|
| Al menos un problema significativo | 45 % |
| Problema de fuente: atribución ausente, engañosa o falsa | 31 % |
| Problema grave de exactitud: detalles inventados, información caducada | 20 % |
| Gemini, respuestas con un problema significativo | 76 % |
Lo peor no es el error, es el aplomo
Una cifra del Tow Center merece aislarse, porque decide todo lo demás. ChatGPT identificó mal 134 artículos de 200, y señaló falta de confianza solo quince veces. Error y duda no están correlacionados: el motor se equivoca en dos tercios de los casos y lo dice en uno de cada trece.
Es la diferencia entre una fuente falible y una fuente engañosa. Un motor que duda deja al lector una señal, y por tanto una oportunidad de verificar. Un motor que afirma no deja nada. Para una empresa significa que una cita errónea no se corrige sola: nada, en la respuesta, invita a nadie a dudar de ella.
Enlaces que no llevan a ninguna parte
La otra constatación es aún más concreta. Más de la mitad de las respuestas de Gemini y de Grok-3 remitían a URL fabricadas o muertas. En Grok-3, 154 citas de 200 acababan en una página de error. El motor no se limita a atribuir mal: inventa una dirección con apariencia de prueba.
El estudio de la EBU describe la misma mecánica del lado de la fuente: afirmaciones atribuidas a redacciones que nunca las habían formulado, enlaces que llevan a un artículo sobre otro tema o a una página desaparecida, y a veces una cita completa - nombre del medio, titular, fecha - de un artículo que nunca existió. Una referencia bien formada no es una referencia verdadera.
Lo que esto cambia para una marca
El razonamiento se traslada directamente. Si un motor puede atribuir una frase a una redacción que no la escribió, puede atribuir su argumento, su precio o su especialidad a un competidor, o al revés, achacarle una promesa que nunca hizo. En ambos casos usted está « citado », y en ambos el contador que solo cuenta citas muestra una buena noticia.
Es el límite de una puntuación de visibilidad tomada aisladamente, la nuestra incluida. Aparecer es una condición necesaria, no es la medida del resultado. Una cita se lee con tres preguntas: ¿nos nombran?, ¿lo que se nos atribuye es exacto?, ¿y el enlace propuesto lleva a una página que existe?
Estos estudios tratan de actualidad, no de recomendaciones de empresas.
El protocolo del Tow Center consiste en rastrear el origen de un extracto de prensa; el de la EBU hace que periodistas evalúen respuestas de actualidad. El mecanismo de la atribución es el mismo, pero el traslado a recomendaciones comerciales es nuestro y no fue medido por estos trabajos.
Datan de 2025, y los modelos han cambiado desde entonces.
El Tow Center publicó en marzo de 2025, la EBU y la BBC en octubre de 2025. Las versiones probadas ya no son las servidas hoy, y ninguna de estas mediciones dice qué daría el mismo protocolo este mes. No lo hemos rehecho.
Una media entre ocho motores esconde diferencias enormes.
Entre el 37 % y el 94 % de errores según el motor, el « más del 60 % » global es una media que el peor eleva. Citar esa única cifra para hablar de un motor concreto sería un error de lectura.
No hemos reproducido ninguno de los dos.
Son trabajos publicados por un centro de investigación universitario y por un consorcio de medios de servicio público, leídos en la fuente. No son nuestras mediciones y no las presentamos como tales.
Lo que esto cambia
Lea la cita, no solo el contador.
Ser nombrado y ser bien descrito son dos resultados distintos. Un panel que solo cuenta apariciones no distingue una buena noticia de un error sobre usted.
Compruebe que el enlace existe.
Una dirección inventada en su dominio parece una prueba y no lo es. Pulse lo que propone el motor: la mitad de las respuestas de dos motores probados llevaba a una página muerta.
Vigile lo que se atribuye a sus competidores.
El error va en ambos sentidos: su argumento puede acreditarse a otro nombre, y eso es invisible desde un seguimiento que solo mira el suyo.
No cuente con la duda del motor.
Se equivoca mucho más de lo que vacila: 134 errores frente a 15 reservas sobre 200 respuestas. La seguridad del tono no dice nada de la exactitud del fondo.