Ir al contenido
Waseit
← Todos los artículos
AEOGEO

134 respuestas erróneas de 200, 15 dudas expresadas: ser citado no es ser bien citado

Dos grandes estudios midieron las citas de los motores de IA. Más del 60 % son incorrectas, el 31 % tiene un problema de fuente, y la seguridad nunca baja. Lo que cambia para una marca.

más del 60 %

de las citas incorrectas en 1 600 consultas, ocho motores probados (Tow Center, marzo de 2025)

5 de septiembre de 20269 min de lectura
En este artículo
  1. Lo que midieron dos grandes estudios
  2. Lo peor no es el error, es el aplomo
  3. Enlaces que no llevan a ninguna parte
  4. Lo que esto cambia para una marca
  5. Lo que esto cambia

Respuesta corta: una cita de IA puede nombrarle y equivocarse sobre usted. Las mediciones publicadas no tratan de aparecer, sino de la exactitud de lo que se atribuye: más del 60 % de citas incorrectas en un estudio de 1 600 consultas, un 31 % con problemas de fuente en otro sobre más de 3 000 respuestas. La pregunta útil no es solo « ¿me citan? », sino « ¿lo que me hacen decir es cierto, y el enlace lleva a alguna parte? ».

31 %

de las respuestas con problema de fuente: atribución ausente, engañosa o falsa (EBU y BBC, octubre de 2025)

134 frente a 15

artículos mal identificados por ChatGPT, frente al número de veces que señaló una duda, sobre 200 respuestas

Un motor que se equivoca y lo dice le deja una oportunidad. Un motor que se equivoca con aplomo no la deja: el lector no tiene motivo para ir a verificar.

Lo que midieron dos grandes estudios

El primero procede del Tow Center for Digital Journalism, en Columbia, publicado el 6 de marzo de 2025. El protocolo es simple y reproducible: veinte editores, diez artículos tomados al azar de cada uno, extractos copiados tal cual, y ocho motores de respuesta a los que se pide identificar el titular, el editor de origen, la fecha y la URL. Son 1 600 consultas. En conjunto, los motores dieron una respuesta incorrecta a más del 60 % de ellas.

Citas incorrectas, ocho motores de respuesta, 1 600 consultas (Tow Center, 6 de marzo de 2025). Las cifras por motor citadas aquí son las que el estudio enuncia explícitamente.
MediciónResultado
Conjunto de los ocho motoresmás del 60 % de respuestas incorrectas
Perplexity, el mejor del panel37 % incorrectas
Grok-3, el peor del panel94 % incorrectas
Grok-3, citas que llevan a una página de error154 de 200

El segundo es más amplio y viene de los medios de servicio público. Publicado el 22 de octubre de 2025 por la Unión Europea de Radiodifusión con la BBC, hizo que periodistas profesionales evaluaran más de 3 000 respuestas de ChatGPT, Copilot, Gemini y Perplexity, en 22 organizaciones, 18 países y 14 lenguas. Su conclusión central es que el fallo es sistémico: no depende de la lengua, ni del mercado, ni de un asistente concreto.

Defectos registrados por periodistas en más de 3 000 respuestas, 22 medios de servicio público, 18 países, 14 lenguas (EBU y BBC, 22 de octubre de 2025).
Tipo de defectoPorcentaje de las respuestas
Al menos un problema significativo45 %
Problema de fuente: atribución ausente, engañosa o falsa31 %
Problema grave de exactitud: detalles inventados, información caducada20 %
Gemini, respuestas con un problema significativo76 %

Lo peor no es el error, es el aplomo

Una cifra del Tow Center merece aislarse, porque decide todo lo demás. ChatGPT identificó mal 134 artículos de 200, y señaló falta de confianza solo quince veces. Error y duda no están correlacionados: el motor se equivoca en dos tercios de los casos y lo dice en uno de cada trece.

Es la diferencia entre una fuente falible y una fuente engañosa. Un motor que duda deja al lector una señal, y por tanto una oportunidad de verificar. Un motor que afirma no deja nada. Para una empresa significa que una cita errónea no se corrige sola: nada, en la respuesta, invita a nadie a dudar de ella.

Enlaces que no llevan a ninguna parte

La otra constatación es aún más concreta. Más de la mitad de las respuestas de Gemini y de Grok-3 remitían a URL fabricadas o muertas. En Grok-3, 154 citas de 200 acababan en una página de error. El motor no se limita a atribuir mal: inventa una dirección con apariencia de prueba.

El estudio de la EBU describe la misma mecánica del lado de la fuente: afirmaciones atribuidas a redacciones que nunca las habían formulado, enlaces que llevan a un artículo sobre otro tema o a una página desaparecida, y a veces una cita completa - nombre del medio, titular, fecha - de un artículo que nunca existió. Una referencia bien formada no es una referencia verdadera.

Lo que esto cambia para una marca

El razonamiento se traslada directamente. Si un motor puede atribuir una frase a una redacción que no la escribió, puede atribuir su argumento, su precio o su especialidad a un competidor, o al revés, achacarle una promesa que nunca hizo. En ambos casos usted está « citado », y en ambos el contador que solo cuenta citas muestra una buena noticia.

Es el límite de una puntuación de visibilidad tomada aisladamente, la nuestra incluida. Aparecer es una condición necesaria, no es la medida del resultado. Una cita se lee con tres preguntas: ¿nos nombran?, ¿lo que se nos atribuye es exacto?, ¿y el enlace propuesto lleva a una página que existe?

  • Estos estudios tratan de actualidad, no de recomendaciones de empresas.

    El protocolo del Tow Center consiste en rastrear el origen de un extracto de prensa; el de la EBU hace que periodistas evalúen respuestas de actualidad. El mecanismo de la atribución es el mismo, pero el traslado a recomendaciones comerciales es nuestro y no fue medido por estos trabajos.

  • Datan de 2025, y los modelos han cambiado desde entonces.

    El Tow Center publicó en marzo de 2025, la EBU y la BBC en octubre de 2025. Las versiones probadas ya no son las servidas hoy, y ninguna de estas mediciones dice qué daría el mismo protocolo este mes. No lo hemos rehecho.

  • Una media entre ocho motores esconde diferencias enormes.

    Entre el 37 % y el 94 % de errores según el motor, el « más del 60 % » global es una media que el peor eleva. Citar esa única cifra para hablar de un motor concreto sería un error de lectura.

  • No hemos reproducido ninguno de los dos.

    Son trabajos publicados por un centro de investigación universitario y por un consorcio de medios de servicio público, leídos en la fuente. No son nuestras mediciones y no las presentamos como tales.

Lo que esto cambia

Lea la cita, no solo el contador.

Ser nombrado y ser bien descrito son dos resultados distintos. Un panel que solo cuenta apariciones no distingue una buena noticia de un error sobre usted.

Compruebe que el enlace existe.

Una dirección inventada en su dominio parece una prueba y no lo es. Pulse lo que propone el motor: la mitad de las respuestas de dos motores probados llevaba a una página muerta.

Vigile lo que se atribuye a sus competidores.

El error va en ambos sentidos: su argumento puede acreditarse a otro nombre, y eso es invisible desde un seguimiento que solo mira el suyo.

No cuente con la duda del motor.

Se equivoca mucho más de lo que vacila: 134 errores frente a 15 reservas sobre 200 respuestas. La seguridad del tono no dice nada de la exactitud del fondo.

Preguntas frecuentes

¿Puede una cita de IA perjudicar a mi empresa?
Sí, y es el punto que se les escapa a los contadores de visibilidad. Los estudios publicados recogen afirmaciones atribuidas a fuentes que nunca las habían formulado, y enlaces que llevan a páginas inexistentes. Trasladado a una marca, significa que una respuesta puede achacarle un precio, una especialidad o una promesa que no son suyos, contándole aun así como citado.
¿Qué motor cita con más exactitud?
En el estudio del Tow Center de marzo de 2025, Perplexity era el mejor del panel con un 37 % de respuestas incorrectas, y Grok-3 el peor con un 94 %. Caben dos reservas: esas versiones ya no son las servidas hoy, y un 37 % de error sigue siendo una tasa alta. Ningún motor del panel era fiable en el sentido corriente de la palabra.
¿Cómo comprobar lo que una IA dice de nosotros?
Haga la pregunta como la haría un cliente, y luego lea la respuesta en tres tiempos: ¿aparece su nombre?, ¿es exacto lo que se le atribuye?, ¿y el enlace propuesto lleva a una página que existe? Repita la medición en el tiempo, porque la respuesta de un día no predice la del siguiente. Es lo que hace nuestro seguimiento, y es también lo que usted puede hacer a mano.