Drei Tage später hat sich die Liste kaum bewegt - 6 Punkte, gegenüber 46 für eine andere Frage
Wir verkaufen wiederholte Messung. Also haben wir geprüft, ob die Liste von Tag zu Tag driftet. Sie tut es kaum - und bei einer Maschine überhaupt nicht.
In diesem Artikel
Kurze Antwort: Der Tag, an dem Sie fragen, ändert fast nichts. Wie Sie fragen, ändert alles. Drei Tage auseinander liefert dieselbe Frage 70 % Überschneidung, gegenüber 76 % zwischen zwei Durchläufen im Minutenabstand. Sechs Punkte. Gestern haben wir gemessen, dass ein anderer Kaufkontext 46 kostet.
Wir verkaufen wiederholte Messung. Es käme uns gelegen zu schließen, man müsse oft messen - und genau deshalb musste die Frage sauber gestellt werden, mit der unbequemen Antwort im Voraus akzeptiert.
Was die Liste bewegt, ist nicht der Kalender. Es ist die Frage, und es ist die Maschine.
Was wir gemessen haben
Dieselbe Referenzfrage, die alle unsere Messungen seit dem 23. August verwenden - zeichengleich, geprüft statt angenommen. Vier globale Branchen, zwei Sprachen, zwei Assistenten, die suchen. 60 Durchläufe heute, null Fehlschläge, dazu eine Erhebung vom 24. August als Vergleichspunkt über drei Tage.
Der Rauschboden bleibt das tragende Stück. Ein Assistent widerspricht sich schon im Minutenabstand. Ein Unterschied zwischen zwei Tagen bedeutet nichts, solange er nicht gegen das gelesen wird, was der Zufall in Minuten erzeugt. Wir haben die Frage daher heute dreimal gestellt, um den Boden des Tages selbst zu haben, statt den von vorgestern zu importieren.
Das Ergebnis
| Abstand zwischen den beiden Durchläufen | Bereinigt | Roh |
|---|---|---|
| Am selben Tag, Minuten auseinander (Boden) | 76 % | 61 % |
| Drei Tage | 70 % | 53 % |
| Abstand zum Boden | 6 Punkte | 8 Punkte |
Sechs Punkte in der strengsten Rechnung, acht in der rohen. So oder so ähnelt die Liste von vor drei Tagen der heutigen etwa so sehr wie zwei Durchläufe derselben Minute.
Und hier hören die beiden Maschinen auf, sich zu ähneln
| Maschine | Selber Tag | Drei Tage | Abstand |
|---|---|---|---|
| Perplexity | 85 % | 71 % | 14 Punkte |
| Gemini | 68 % | 69 % | keiner |
Gemini driftet überhaupt nicht. Drei Tage später ähnelt seine Liste der heutigen genau so sehr wie zwei seiner eigenen aufeinanderfolgenden Antworten. Das ist keine Stabilität: Es ist bereits so wenig mit sich selbst konsistent - 68 % zwischen aufeinanderfolgenden Durchläufen -, dass drei Tage nichts mehr hinzuzufügen haben.
Perplexity ist das Gegenteil. Es wiederholt sich kurzfristig gut, 85 %, und gerade deshalb wird eine echte Drift sichtbar: 14 Punkte in drei Tagen. Dort ergibt eine Messung im Wochenabstand einen Sinn, weil das Rauschen das Signal nicht ertränkt.
Bei der einen Maschine hat „wie oft soll ich messen?“ eine Antwort. Bei der anderen stellt sich die Frage nicht, weil dort ein einzelner Durchlauf schon nichts bedeutet.
Sechs gegen sechsundvierzig
Die Zahl bedeutet erst neben der von gestern etwas, gewonnen im selben Aufbau, mit demselben Boden und derselben Bereinigung.
| Was verändert wird | Kosten in Punkten |
|---|---|
| Der Tag, an dem gefragt wird (3 Tage) | 6 |
| Der Preis als Kriterium („bestes Preis-Leistungs-Verhältnis“) | 24 |
| Das Niveau („ich bin Anfänger“) | 37 |
| Der Kontext („mein Unternehmen mit 10 Personen“) | 46 |
Siebenmal mehr. Eine Prüfung, die täglich dieselbe Formulierung wiederholt, misst sehr genau ein Achtel des Themas. Ein Messbudget liegt besser in der Vielfalt der Fragen als in ihrer Häufigkeit.
Was wir daraus für unser eigenes Produkt ziehen
Tägliches Messen ist in diesem Stadium nicht zu rechtfertigen.
Über drei Tage bleibt der Abstand im Rauschen. Wir werden keine Taktung verkaufen, die unsere eigenen Zahlen nicht tragen.
Eine einzelne Messung bleibt unbrauchbar
, und das ist die andere Seite desselben Ergebnisses: Bei 68 % Überschneidung zwischen aufeinanderfolgenden Antworten belegt ein einzelner Durchlauf auf Gemini gar nichts. Wiederholung dient dazu, Rauschen zum Schweigen zu bringen, nicht dazu, Nachrichten zu verfolgen.
Die nützliche Taktung hängt von der Maschine ab.
Bei Perplexity zeigt sich eine echte Drift in drei Tagen. Bei Gemini braucht es zuerst mehrere Durchläufe, um überhaupt zu wissen, wovon die Rede ist.
Der Hebel ist die Vielfalt der Fragen.
Dort liegen 46 Punkte, gegenüber 6 für den Kalender.
Die Grenzen, und ein selbstverschuldeter Datenverlust
Wir haben unsere eigenen Daten vom 26. August zerstört. Ein Auswertungsskript importierte eine Funktion aus dem Sammler des Vortages; dieser Sammler führte seine Messung beim Laden des Moduls aus und überschrieb seine Ausgabedatei. 120 Durchläufe auf 12 reduziert, ohne Kopie. Die Vergleiche über einen und zwei Tage, die dieser Artikel tragen sollte, sind damit nicht messbar: Die Messung eines vergangenen Tages lässt sich nicht nachholen. Es bleiben der Boden des Tages und der Abstand über drei Tage. Ein Schutz wurde eingebaut, sodass ein Import nichts mehr auslöst.
Zwei Zeitpunkte, keine Kurve.
Sechs Punkte über drei Tage sagen nichts darüber, wie sich Drift über eine Woche oder einen Monat verhält. Wir extrapolieren nicht.
Vier Branchen, zwei Sprachen, zwei Maschinen.
Laufschuhe sind ausgenommen: Die Antworten nennen dort nummerierte Modelle, die unser Extraktor verwirft, wodurch die Branche überall auf 0 % kam - ein Filterartefakt, kein Ergebnis.
Unser Extraktor bleibt unvollkommen.
Deshalb stehen beide Bereinigungsstufen nebeneinander: Die Schlussfolgerung hält in beiden, oder es gibt keine.
Eine ruhige Phase bleibt eine ruhige Phase.
In diesen drei Tagen gab es in den geprüften Branchen keine große Markteinführung und keinen angekündigten Modellwechsel. Geringe Drift bei Ruhe verspricht nichts bei Unruhe.
Wir versprechen niemandem einen Platz in den Antworten von ChatGPT - das kann niemand seriös. Messbar ist, wo Sie stehen: je Sprache, je Maschine, je gestellter Frage. Und nun mit einer Vorstellung davon, was die Zeit damit macht.