Ändern sich KI-Empfehlungen von einem Tag auf den anderen?
Heute Morgen nachgemessen: von 81 Namen, die KI-Assistenten am 6. August nannten, tauchen am 8. nur 15 wieder auf. Was 48 Stunden hält, was sich bewegt, und warum.
In diesem Artikel
Vor gut einem Jahr, am 7. August 2025, tauschte OpenAI über Nacht das Standardmodell von ChatGPT gegen GPT-5 aus. Millionen Nutzer sahen Ton und Inhalt der Antworten auf einen Schlag wechseln; der Widerspruch war laut genug, dass das ältere Modell am 12. August für zahlende Abonnenten zurückkam. Dann geschah es wieder: am 5. Mai 2026 wurde GPT-5.5 Instant der neue Standard. Zweimal in einem Jahr wechselte der Motor unter dem Assistenten - ohne Vorankündigung an die Betriebe, deren Namen er nennt oder nicht mehr nennt.
Sollten Betriebe sich Sorgen machen? Wir haben lieber gemessen. Heute Morgen, am 8. August 2026, haben wir die vier Fragen vom 6. August Wort für Wort erneut gestellt - nach den besten Klempnern in Bordeaux und Lille, so formuliert, wie ein Kunde sie tippt -, an dieselben drei Assistenten: ChatGPT, Gemini, Perplexity. Zwölf Antworten erneut erhoben, verglichen mit den zwölf von Donnerstag. Die Antwort auf die Frage im Titel: ja, und zwar massiv. Von 81 verschiedenen Namen vom Donnerstag tauchen am Samstag nur 15 wieder auf - und zwei dieser fünfzehn sind Zwischenüberschriften, die der Zähler eingefangen hat, keine Betriebe. Etwa einer von sechs genannten Namen überlebte 48 Stunden. Diese Unbeständigkeit ist das Erste, dem AEO (Answer Engine Optimization: in den Antworten der Assistenten zu existieren) ins Auge sehen muss.
Was genau haben wir heute Morgen gemessen?
Das Vorgehen passt in einen Satz: dieselben Fragen, dieselben drei Engines, dieselben Modelle, 48 Stunden Abstand, zwölf Antworten auf jeder Seite, Namen gezählt vom selben Auswerter wie in unseren Berichten - jeder Unterschied ist also Bewegung der Antworten, nicht der Methode. Die Aufschlüsselung nach Engine ist der eigentliche Befund. ChatGPT, über die Schnittstelle ohne Websuche befragt: null behaltene Namen von 26. Gemini: einer von 29 - Espace Aubade, eine landesweite Sanitärhandelskette. Perplexity, der einzige der drei, der beim Antworten das Web liest: 12 behaltene Namen von 28.
Der am Donnerstag selbstsicher genannte Name wird am Samstag nicht mehr genannt - nicht einmal von der Engine, die ihn vorgebracht hatte.
Der sprechendste Fall: am Donnerstag empfahl ChatGPT „Plomberie Lille Services“, mitsamt selbstsicher klingender Gründe - ein Name, den wir keinem identifizierbaren Betrieb zuordnen konnten und als unbestätigt kennzeichneten. Am Samstag erwähnt es ihn gar nicht mehr. Nicht einmal sein Urheber wiederholt ihn. Auch seine Absagen sind nicht beständig: drei von vier Fragen am Donnerstag abgelehnt, zwei von vier am Samstag.
Warum halten so wenige Namen?
Weil Beständigkeit keine Eigenschaft „der KI“ ist: sie ist eine Eigenschaft ihrer Quellen. ChatGPT antwortet aus dem Gedächtnis - es schreibt es am Samstag selbst: „auf Grundlage von Bewertungen und Empfehlungen, die bis 2023 verfügbar waren“ (unsere Übersetzung). Ein Gedächtnis, aus dem bei jeder Erzeugung neu gezogen wird, liefert bei jedem Zug eine andere Liste. Perplexity liest die Verzeichnisse zum Fragezeitpunkt neu: seine Namen halten, weil Bilik, ThreeBestRated oder Travaux.com sich in 48 Stunden nicht geändert haben. Und sehen Sie, was auf seiner Seite überlebte: zuerst die Verzeichnisse und Plattformen selbst, dann die Handwerker, die sie einordnen. Die stabile Schicht Ihrer KI-Sichtbarkeit sind die geschriebenen Quellen - nicht das Los einer einzelnen Erzeugung.
Nehmen Sie die Größenordnung dazu: wenn das Standardmodell wechselt - 7. August 2025, 5. Mai 2026 -, werden die Antworten für zig Millionen Nutzer am selben Tag neu gemischt. Ihre Punktzahl kann sich bewegen, ohne dass Sie, Ihre Wettbewerber oder Ihre Kunden irgendetwas getan hätten. Eine einzelne Momentaufnahme, gut oder schlecht, sagt deshalb fast nichts; was spricht, ist die Reihe - wie oft Ihr Name zurückkommt, Messung für Messung, und die Quellen, die ihn tragen.
Was sollten Sie morgen früh tun?
- Ziehen Sie aus einer einzelnen Messung keinen Schluss - keine Panik wegen einer Null, keine Ehrenrunde wegen einer guten Punktzahl. Messen Sie in regelmäßigem Takt nach: der Verlauf bedeutet etwas, der Punkt nicht.
- Investieren Sie in die Schicht, die gehalten hat: die Verzeichnisse und Plattformen, die die web-lesende Engine heranzieht. In unserer Messung kamen die einzigen Handwerker, die 48 Stunden später noch genannt wurden, von dort.
- Notieren Sie sich die Termine der Modellwechsel (sie sind öffentlich). Bewegt sich Ihre Sichtbarkeit an einem solchen Tag, liegt die Ursache wahrscheinlich über Ihnen - nicht in Ihrem Betrieb.
- Messen Sie die drei Engines getrennt, kostenlos, in 60 Sekunden - und messen Sie nächsten Monat erneut. Der Vergleich ist das Produkt, nicht das Foto.
Die übliche Ehrlichkeit zum Schluss: vier Fragen, zwölf Antworten, zwei Städte, ein Gewerbe - das ist eine Sondierung, keine Vollerhebung. Aber die Größenordnung deckt sich mit dem, was unsere drei nationalen Studien schon zeigen (die Engines stimmen bei nur 2 bis 3 % der Namen miteinander überein), und sie ist datiert, veröffentlicht und nachprüfbar. Eine KI-Empfehlung ist ein Ereignis, kein Zustand. Ein Ereignis verwaltet man nicht - man verwaltet seine Häufigkeit.