Ir al contenido
Waseit
← Todos los artículos
AEOGEO

Tres días después, la lista apenas se ha movido: 6 puntos, frente a 46 por otra pregunta

Vendemos medición repetida. Así que comprobamos si la lista cambia de un día para otro. Apenas cambia, y en un motor no cambia nada.

27 de agosto de 20269 min de lectura
En este artículo
  1. Qué medimos
  2. El resultado
  3. Y aquí los dos motores dejan de parecerse
  4. Seis contra cuarenta y seis
  5. Qué sacamos de esto para nuestro propio producto
  6. Los límites, y una pérdida de datos por culpa nuestra

Respuesta corta: el día en que se pregunta no cambia casi nada. La forma de preguntar lo cambia todo. Con tres días de diferencia, la misma pregunta da un 70 % de coincidencia, frente al 76 % entre dos ejecuciones hechas con minutos de diferencia. Seis puntos. Ayer medimos que cambiar el contexto de compra costaba 46.

Vendemos medición repetida. Nos vendría bien concluir que hay que medir a menudo, y precisamente por eso había que plantear la pregunta como es debido, aceptando de antemano la respuesta que nos incomoda.

Lo que mueve la lista no es el calendario. Es la pregunta, y es el motor.

Qué medimos

La misma pregunta de referencia que usan todas nuestras mediciones desde el 23 de agosto: idéntica carácter a carácter, verificada y no supuesta. Cuatro sectores globales, dos idiomas, dos asistentes que buscan. 60 ejecuciones hoy, cero fallos, más una recogida del 24 de agosto conservada como punto de comparación a tres días.

El suelo de ruido sigue siendo la pieza que lo sostiene todo. Un asistente ya se contradice a sí mismo con minutos de diferencia. Una diferencia entre dos días no significa nada hasta que se lee contra lo que el azar produce en minutos. Por eso ejecutamos la pregunta tres veces hoy, para tener el suelo del propio día en lugar de importar el de anteayer.

El resultado

Coincidencia de las listas recomendadas. Cuatro sectores, inglés y francés, Perplexity y Gemini, 2026-08-27. El cálculo «limpio» conserva solo los nombres que se repiten en varias respuestas; el bruto se publica al lado para que el lector vea qué cambia la limpieza.
Distancia entre las dos ejecucionesLimpioBruto
El mismo día, con minutos de diferencia (suelo)76 %61 %
Tres días70 %53 %
Distancia al suelo6 puntos8 puntos

Seis puntos en el cálculo más severo, ocho en el bruto. En ambos casos, la lista de hace tres días se parece a la de hoy más o menos tanto como dos ejecuciones hechas en el mismo minuto.

Y aquí los dos motores dejan de parecerse

El mismo cálculo, motor por motor. Un promedio entre ambos le prestaría a uno la estabilidad del otro.
MotorMismo díaTres díasDistancia
Perplexity85 %71 %14 puntos
Gemini68 %69 %ninguna

Gemini no se mueve en absoluto. Tres días después, su lista se parece a la de hoy exactamente tanto como dos de sus propias respuestas consecutivas. No es estabilidad: es que ya es tan poco constante consigo mismo - 68 % entre ejecuciones sucesivas - que tres días ya no tienen nada que añadir.

Perplexity es lo contrario. Se repite bien a corto plazo, 85 %, y justo por eso un cambio real se vuelve visible: 14 puntos en tres días. Ahí, medir con una semana de diferencia tiene sentido, porque el ruido no ahoga la señal.

En un motor, «¿cada cuánto debo medir?» tiene respuesta. En el otro la pregunta ni se plantea, porque allí una sola ejecución ya no significa nada.

Seis contra cuarenta y seis

La cifra solo cobra sentido junto a la de ayer, obtenida con el mismo diseño, el mismo suelo y la misma limpieza.

Qué desplaza la lista recomendada, en puntos por debajo del suelo de ruido. Dos mediciones, dos días seguidos, un método.
Lo que se cambiaCoste en puntos
El día en que se pregunta (3 días)6
El precio como criterio («mejor relación calidad-precio»)24
El nivel («soy principiante»)37
El contexto («mi empresa de 10 personas»)46

Siete veces más. Una auditoría que repite cada día la misma formulación mide, con mucha precisión, un octavo del asunto. El presupuesto de medición está mejor puesto en la variedad de las preguntas que en su frecuencia.

Qué sacamos de esto para nuestro propio producto

Medir a diario no tiene justificación en esta fase.

En tres días la diferencia se queda dentro del ruido. No venderemos una cadencia que nuestras propias cifras no sostienen.

Una medición aislada sigue siendo inservible

, y es la otra cara del mismo resultado: con un 68 % de coincidencia entre respuestas consecutivas, una sola ejecución en Gemini no establece nada. La repetición sirve para callar el ruido, no para seguir la actualidad.

La cadencia útil depende del motor.

En Perplexity un cambio real aparece en tres días. En Gemini hacen falta primero varias ejecuciones para saber de qué se habla.

La palanca es la variedad de las preguntas.

Ahí están 46 puntos, frente a 6 del calendario.

Los límites, y una pérdida de datos por culpa nuestra

Destruimos nuestros propios datos del 26 de agosto. Un script de análisis importó una función del recolector de la víspera; ese recolector ejecutaba su medición al cargar el módulo y reescribió su fichero de salida. 120 ejecuciones reducidas a 12, sin copia. Las comparaciones a un y a dos días que este artículo debía contener no son, por tanto, medibles: la medición de un día pasado no se rehace. Quedan el suelo del día y la diferencia a tres días. Se ha añadido una salvaguarda para que importar no dispare nada.

Dos puntos en el tiempo, no una curva.

Seis puntos a tres días no dicen nada sobre cómo se comporta la deriva a una semana o a un mes. No lo extrapolamos.

Cuatro sectores, dos idiomas, dos motores.

Las zapatillas de running quedan fuera: las respuestas citan modelos numerados que nuestro extractor descarta, lo que hacía salir el sector al 0 % en todas partes: un artefacto del filtro, no un resultado.

Nuestro extractor sigue siendo imperfecto.

Por eso los dos niveles de limpieza se publican uno junto al otro: la conclusión se sostiene en ambos, o no hay conclusión.

Un periodo tranquilo sigue siendo un periodo tranquilo.

En estos tres días no hubo lanzamiento importante ni cambio de modelo anunciado en los sectores probados. Poca deriva en calma no promete nada en tormenta.

No prometemos a nadie un puesto en las respuestas de ChatGPT: nadie puede hacerlo honestamente. Lo que se mide es dónde está usted: por idioma, por motor, por pregunta formulada. Y, ahora, con alguna idea de lo que el tiempo le hace.

Preguntas frecuentes

¿Cada cuánto debo medir mi visibilidad en las IA?
Menos de lo que se cree, según nuestra medición del 27 de agosto de 2026. Con tres días de diferencia, la lista recomendada coincide en un 70 %, frente al 76 % entre dos ejecuciones hechas con minutos de diferencia: solo seis puntos. El presupuesto de medición está mejor puesto en la variedad de las preguntas que en su frecuencia.
¿La lista de empresas que recomienda una IA cambia de un día para otro?
Muy poco en tres días, y depende del motor. Perplexity, que se repite bien a corto plazo (85 %), muestra una deriva real de 14 puntos en tres días. Gemini no muestra ninguna: no por estabilidad, sino porque ya es tan poco constante consigo mismo (68 % entre respuestas consecutivas) que tres días no añaden nada.
¿Qué mueve más las recomendaciones de una IA?
La pregunta, no el calendario. Cambiar el contexto de compra - «cuáles son los mejores X» frente a «cuál para mi empresa de diez personas» - cuesta 46 puntos de coincidencia. Esperar tres días cuesta 6. Es siete a uno, medido con el mismo diseño en dos días seguidos.
¿Basta una sola auditoría para saber si una IA me recomienda?
No. Dos respuestas consecutivas a la misma pregunta coinciden solo en un 68 % en Gemini y un 85 % en Perplexity. Una sola ejecución no distingue un cambio real del azar del día. La repetición sirve ante todo para callar ese ruido, no para seguir la actualidad.
¿Por qué publicar un resultado que desaconseja medir a diario?
Porque vendemos medición repetida, y una cifra elegida para favorecer a quien vende no vale nada. La pregunta se planteó como es debido, con suelo de ruido y dos niveles de limpieza, y la respuesta se publica tal como vino.