Zum Inhalt springen
Waseit
← Alle Artikel
AEOGEO

Drei Tage später hat sich die Liste kaum bewegt - 6 Punkte, gegenüber 46 für eine andere Frage

Wir verkaufen wiederholte Messung. Also haben wir geprüft, ob die Liste von Tag zu Tag driftet. Sie tut es kaum - und bei einer Maschine überhaupt nicht.

27. August 20269 Min. Lesezeit
In diesem Artikel
  1. Was wir gemessen haben
  2. Das Ergebnis
  3. Und hier hören die beiden Maschinen auf, sich zu ähneln
  4. Sechs gegen sechsundvierzig
  5. Was wir daraus für unser eigenes Produkt ziehen
  6. Die Grenzen, und ein selbstverschuldeter Datenverlust

Kurze Antwort: Der Tag, an dem Sie fragen, ändert fast nichts. Wie Sie fragen, ändert alles. Drei Tage auseinander liefert dieselbe Frage 70 % Überschneidung, gegenüber 76 % zwischen zwei Durchläufen im Minutenabstand. Sechs Punkte. Gestern haben wir gemessen, dass ein anderer Kaufkontext 46 kostet.

Wir verkaufen wiederholte Messung. Es käme uns gelegen zu schließen, man müsse oft messen - und genau deshalb musste die Frage sauber gestellt werden, mit der unbequemen Antwort im Voraus akzeptiert.

Was die Liste bewegt, ist nicht der Kalender. Es ist die Frage, und es ist die Maschine.

Was wir gemessen haben

Dieselbe Referenzfrage, die alle unsere Messungen seit dem 23. August verwenden - zeichengleich, geprüft statt angenommen. Vier globale Branchen, zwei Sprachen, zwei Assistenten, die suchen. 60 Durchläufe heute, null Fehlschläge, dazu eine Erhebung vom 24. August als Vergleichspunkt über drei Tage.

Der Rauschboden bleibt das tragende Stück. Ein Assistent widerspricht sich schon im Minutenabstand. Ein Unterschied zwischen zwei Tagen bedeutet nichts, solange er nicht gegen das gelesen wird, was der Zufall in Minuten erzeugt. Wir haben die Frage daher heute dreimal gestellt, um den Boden des Tages selbst zu haben, statt den von vorgestern zu importieren.

Das Ergebnis

Überschneidung der empfohlenen Listen. Vier Branchen, Englisch und Französisch, Perplexity und Gemini, 2026-08-27. Die „bereinigte“ Rechnung behält nur Namen, die in mehreren Antworten wiederkehren; die rohe steht daneben, damit der Leser sieht, was die Bereinigung ändert.
Abstand zwischen den beiden DurchläufenBereinigtRoh
Am selben Tag, Minuten auseinander (Boden)76 %61 %
Drei Tage70 %53 %
Abstand zum Boden6 Punkte8 Punkte

Sechs Punkte in der strengsten Rechnung, acht in der rohen. So oder so ähnelt die Liste von vor drei Tagen der heutigen etwa so sehr wie zwei Durchläufe derselben Minute.

Und hier hören die beiden Maschinen auf, sich zu ähneln

Dieselbe Rechnung, Maschine für Maschine. Ein Mittelwert über beide liehe der einen die Stabilität der anderen.
MaschineSelber TagDrei TageAbstand
Perplexity85 %71 %14 Punkte
Gemini68 %69 %keiner

Gemini driftet überhaupt nicht. Drei Tage später ähnelt seine Liste der heutigen genau so sehr wie zwei seiner eigenen aufeinanderfolgenden Antworten. Das ist keine Stabilität: Es ist bereits so wenig mit sich selbst konsistent - 68 % zwischen aufeinanderfolgenden Durchläufen -, dass drei Tage nichts mehr hinzuzufügen haben.

Perplexity ist das Gegenteil. Es wiederholt sich kurzfristig gut, 85 %, und gerade deshalb wird eine echte Drift sichtbar: 14 Punkte in drei Tagen. Dort ergibt eine Messung im Wochenabstand einen Sinn, weil das Rauschen das Signal nicht ertränkt.

Bei der einen Maschine hat „wie oft soll ich messen?“ eine Antwort. Bei der anderen stellt sich die Frage nicht, weil dort ein einzelner Durchlauf schon nichts bedeutet.

Sechs gegen sechsundvierzig

Die Zahl bedeutet erst neben der von gestern etwas, gewonnen im selben Aufbau, mit demselben Boden und derselben Bereinigung.

Was die empfohlene Liste verschiebt, in Punkten unter dem Rauschboden. Zwei Messungen, zwei aufeinanderfolgende Tage, eine Methode.
Was verändert wirdKosten in Punkten
Der Tag, an dem gefragt wird (3 Tage)6
Der Preis als Kriterium („bestes Preis-Leistungs-Verhältnis“)24
Das Niveau („ich bin Anfänger“)37
Der Kontext („mein Unternehmen mit 10 Personen“)46

Siebenmal mehr. Eine Prüfung, die täglich dieselbe Formulierung wiederholt, misst sehr genau ein Achtel des Themas. Ein Messbudget liegt besser in der Vielfalt der Fragen als in ihrer Häufigkeit.

Was wir daraus für unser eigenes Produkt ziehen

Tägliches Messen ist in diesem Stadium nicht zu rechtfertigen.

Über drei Tage bleibt der Abstand im Rauschen. Wir werden keine Taktung verkaufen, die unsere eigenen Zahlen nicht tragen.

Eine einzelne Messung bleibt unbrauchbar

, und das ist die andere Seite desselben Ergebnisses: Bei 68 % Überschneidung zwischen aufeinanderfolgenden Antworten belegt ein einzelner Durchlauf auf Gemini gar nichts. Wiederholung dient dazu, Rauschen zum Schweigen zu bringen, nicht dazu, Nachrichten zu verfolgen.

Die nützliche Taktung hängt von der Maschine ab.

Bei Perplexity zeigt sich eine echte Drift in drei Tagen. Bei Gemini braucht es zuerst mehrere Durchläufe, um überhaupt zu wissen, wovon die Rede ist.

Der Hebel ist die Vielfalt der Fragen.

Dort liegen 46 Punkte, gegenüber 6 für den Kalender.

Die Grenzen, und ein selbstverschuldeter Datenverlust

Wir haben unsere eigenen Daten vom 26. August zerstört. Ein Auswertungsskript importierte eine Funktion aus dem Sammler des Vortages; dieser Sammler führte seine Messung beim Laden des Moduls aus und überschrieb seine Ausgabedatei. 120 Durchläufe auf 12 reduziert, ohne Kopie. Die Vergleiche über einen und zwei Tage, die dieser Artikel tragen sollte, sind damit nicht messbar: Die Messung eines vergangenen Tages lässt sich nicht nachholen. Es bleiben der Boden des Tages und der Abstand über drei Tage. Ein Schutz wurde eingebaut, sodass ein Import nichts mehr auslöst.

Zwei Zeitpunkte, keine Kurve.

Sechs Punkte über drei Tage sagen nichts darüber, wie sich Drift über eine Woche oder einen Monat verhält. Wir extrapolieren nicht.

Vier Branchen, zwei Sprachen, zwei Maschinen.

Laufschuhe sind ausgenommen: Die Antworten nennen dort nummerierte Modelle, die unser Extraktor verwirft, wodurch die Branche überall auf 0 % kam - ein Filterartefakt, kein Ergebnis.

Unser Extraktor bleibt unvollkommen.

Deshalb stehen beide Bereinigungsstufen nebeneinander: Die Schlussfolgerung hält in beiden, oder es gibt keine.

Eine ruhige Phase bleibt eine ruhige Phase.

In diesen drei Tagen gab es in den geprüften Branchen keine große Markteinführung und keinen angekündigten Modellwechsel. Geringe Drift bei Ruhe verspricht nichts bei Unruhe.

Wir versprechen niemandem einen Platz in den Antworten von ChatGPT - das kann niemand seriös. Messbar ist, wo Sie stehen: je Sprache, je Maschine, je gestellter Frage. Und nun mit einer Vorstellung davon, was die Zeit damit macht.

Häufige Fragen

Wie oft sollte ich meine KI-Sichtbarkeit messen?
Seltener als man denkt, laut unserer Messung vom 27. August 2026. Drei Tage auseinander überschneidet sich die empfohlene Liste zu 70 %, gegenüber 76 % zwischen zwei Durchläufen im Minutenabstand: nur sechs Punkte Unterschied. Ein Messbudget liegt besser in der Vielfalt der gestellten Fragen als in ihrer Häufigkeit.
Ändert sich die Liste der von einer KI empfohlenen Unternehmen von Tag zu Tag?
Über drei Tage sehr wenig, und es hängt von der Maschine ab. Perplexity, das sich kurzfristig gut wiederholt (85 %), zeigt eine echte Drift von 14 Punkten in drei Tagen. Gemini zeigt keine - nicht aus Stabilität, sondern weil es bereits so wenig mit sich selbst konsistent ist (68 % zwischen aufeinanderfolgenden Antworten), dass drei Tage nichts hinzufügen.
Was bewegt die Empfehlungen einer KI am stärksten?
Die Frage, nicht der Kalender. Den Kaufkontext zu ändern - „was sind die besten X“ gegenüber „welches für mein Zehn-Personen-Unternehmen“ - kostet 46 Punkte Überschneidung. Drei Tage zu warten kostet 6. Das ist sieben zu eins, gemessen im selben Aufbau an zwei aufeinanderfolgenden Tagen.
Genügt eine einzige Prüfung, um zu wissen, ob eine KI mich empfiehlt?
Nein. Zwei aufeinanderfolgende Antworten auf dieselbe Frage überschneiden sich nur zu 68 % bei Gemini und 85 % bei Perplexity. Ein einzelner Durchlauf kann eine echte Veränderung nicht vom Zufall des Tages unterscheiden. Wiederholung dient zuerst dazu, dieses Rauschen zum Schweigen zu bringen.
Warum ein Ergebnis veröffentlichen, das gegen tägliches Messen spricht?
Weil wir wiederholte Messung verkaufen und eine Zahl, die dem Verkäufer passt, nichts wert ist. Die Frage wurde ordentlich gestellt, mit Rauschboden und zwei Bereinigungsstufen, und die Antwort wird so veröffentlicht, wie sie kam.