Tres días después, la lista apenas se ha movido: 6 puntos, frente a 46 por otra pregunta
Vendemos medición repetida. Así que comprobamos si la lista cambia de un día para otro. Apenas cambia, y en un motor no cambia nada.
En este artículo
Respuesta corta: el día en que se pregunta no cambia casi nada. La forma de preguntar lo cambia todo. Con tres días de diferencia, la misma pregunta da un 70 % de coincidencia, frente al 76 % entre dos ejecuciones hechas con minutos de diferencia. Seis puntos. Ayer medimos que cambiar el contexto de compra costaba 46.
Vendemos medición repetida. Nos vendría bien concluir que hay que medir a menudo, y precisamente por eso había que plantear la pregunta como es debido, aceptando de antemano la respuesta que nos incomoda.
Lo que mueve la lista no es el calendario. Es la pregunta, y es el motor.
Qué medimos
La misma pregunta de referencia que usan todas nuestras mediciones desde el 23 de agosto: idéntica carácter a carácter, verificada y no supuesta. Cuatro sectores globales, dos idiomas, dos asistentes que buscan. 60 ejecuciones hoy, cero fallos, más una recogida del 24 de agosto conservada como punto de comparación a tres días.
El suelo de ruido sigue siendo la pieza que lo sostiene todo. Un asistente ya se contradice a sí mismo con minutos de diferencia. Una diferencia entre dos días no significa nada hasta que se lee contra lo que el azar produce en minutos. Por eso ejecutamos la pregunta tres veces hoy, para tener el suelo del propio día en lugar de importar el de anteayer.
El resultado
| Distancia entre las dos ejecuciones | Limpio | Bruto |
|---|---|---|
| El mismo día, con minutos de diferencia (suelo) | 76 % | 61 % |
| Tres días | 70 % | 53 % |
| Distancia al suelo | 6 puntos | 8 puntos |
Seis puntos en el cálculo más severo, ocho en el bruto. En ambos casos, la lista de hace tres días se parece a la de hoy más o menos tanto como dos ejecuciones hechas en el mismo minuto.
Y aquí los dos motores dejan de parecerse
| Motor | Mismo día | Tres días | Distancia |
|---|---|---|---|
| Perplexity | 85 % | 71 % | 14 puntos |
| Gemini | 68 % | 69 % | ninguna |
Gemini no se mueve en absoluto. Tres días después, su lista se parece a la de hoy exactamente tanto como dos de sus propias respuestas consecutivas. No es estabilidad: es que ya es tan poco constante consigo mismo - 68 % entre ejecuciones sucesivas - que tres días ya no tienen nada que añadir.
Perplexity es lo contrario. Se repite bien a corto plazo, 85 %, y justo por eso un cambio real se vuelve visible: 14 puntos en tres días. Ahí, medir con una semana de diferencia tiene sentido, porque el ruido no ahoga la señal.
En un motor, «¿cada cuánto debo medir?» tiene respuesta. En el otro la pregunta ni se plantea, porque allí una sola ejecución ya no significa nada.
Seis contra cuarenta y seis
La cifra solo cobra sentido junto a la de ayer, obtenida con el mismo diseño, el mismo suelo y la misma limpieza.
| Lo que se cambia | Coste en puntos |
|---|---|
| El día en que se pregunta (3 días) | 6 |
| El precio como criterio («mejor relación calidad-precio») | 24 |
| El nivel («soy principiante») | 37 |
| El contexto («mi empresa de 10 personas») | 46 |
Siete veces más. Una auditoría que repite cada día la misma formulación mide, con mucha precisión, un octavo del asunto. El presupuesto de medición está mejor puesto en la variedad de las preguntas que en su frecuencia.
Qué sacamos de esto para nuestro propio producto
Medir a diario no tiene justificación en esta fase.
En tres días la diferencia se queda dentro del ruido. No venderemos una cadencia que nuestras propias cifras no sostienen.
Una medición aislada sigue siendo inservible
, y es la otra cara del mismo resultado: con un 68 % de coincidencia entre respuestas consecutivas, una sola ejecución en Gemini no establece nada. La repetición sirve para callar el ruido, no para seguir la actualidad.
La cadencia útil depende del motor.
En Perplexity un cambio real aparece en tres días. En Gemini hacen falta primero varias ejecuciones para saber de qué se habla.
La palanca es la variedad de las preguntas.
Ahí están 46 puntos, frente a 6 del calendario.
Los límites, y una pérdida de datos por culpa nuestra
Destruimos nuestros propios datos del 26 de agosto. Un script de análisis importó una función del recolector de la víspera; ese recolector ejecutaba su medición al cargar el módulo y reescribió su fichero de salida. 120 ejecuciones reducidas a 12, sin copia. Las comparaciones a un y a dos días que este artículo debía contener no son, por tanto, medibles: la medición de un día pasado no se rehace. Quedan el suelo del día y la diferencia a tres días. Se ha añadido una salvaguarda para que importar no dispare nada.
Dos puntos en el tiempo, no una curva.
Seis puntos a tres días no dicen nada sobre cómo se comporta la deriva a una semana o a un mes. No lo extrapolamos.
Cuatro sectores, dos idiomas, dos motores.
Las zapatillas de running quedan fuera: las respuestas citan modelos numerados que nuestro extractor descarta, lo que hacía salir el sector al 0 % en todas partes: un artefacto del filtro, no un resultado.
Nuestro extractor sigue siendo imperfecto.
Por eso los dos niveles de limpieza se publican uno junto al otro: la conclusión se sostiene en ambos, o no hay conclusión.
Un periodo tranquilo sigue siendo un periodo tranquilo.
En estos tres días no hubo lanzamiento importante ni cambio de modelo anunciado en los sectores probados. Poca deriva en calma no promete nada en tormenta.
No prometemos a nadie un puesto en las respuestas de ChatGPT: nadie puede hacerlo honestamente. Lo que se mide es dónde está usted: por idioma, por motor, por pregunta formulada. Y, ahora, con alguna idea de lo que el tiempo le hace.