Trzy dni później lista prawie się nie zmieniła - 6 punktów wobec 46 przy innym pytaniu
Sprzedajemy pomiar powtarzany. Sprawdziliśmy więc, czy lista dryfuje z dnia na dzień. Prawie nie dryfuje, a w jednym silniku wcale.
W tym artykule
Krótka odpowiedź: dzień, w którym pytasz, prawie nic nie zmienia. Sposób pytania zmienia wszystko. Przy trzech dniach odstępu to samo pytanie daje 70 % pokrycia, wobec 76 % między dwoma uruchomieniami w odstępie minut. Sześć punktów. Wczoraj zmierzyliśmy, że zmiana kontekstu zakupowego kosztuje 46.
Sprzedajemy pomiar powtarzany. Byłoby nam na rękę stwierdzić, że mierzyć trzeba często - i właśnie dlatego pytanie trzeba było postawić uczciwie, z góry przyjmując niewygodną odpowiedź.
Tym, co porusza listę, nie jest kalendarz. To pytanie i to silnik.
Co zmierzyliśmy
To samo pytanie odniesienia, którego używają wszystkie nasze pomiary od 23 sierpnia - identyczne co do znaku, sprawdzone, a nie założone. Cztery globalne branże, dwa języki, dwaj asystenci, którzy szukają. 60 uruchomień dzisiaj, zero niepowodzeń, plus zbiór z 24 sierpnia zachowany jako punkt porównania po trzech dniach.
Próg szumu pozostaje elementem nośnym. Asystent przeczy sam sobie już w odstępie minut. Różnica między dwoma dniami nic nie znaczy, dopóki nie odczyta się jej wobec tego, co losowość wytwarza w ciągu minut. Uruchomiliśmy więc pytanie trzy razy dzisiaj, żeby mieć próg tego samego dnia, zamiast importować przedwczorajszy.
Wynik
| Odstęp między dwoma uruchomieniami | Oczyszczony | Surowy |
|---|---|---|
| Ten sam dzień, kilka minut (próg) | 76 % | 61 % |
| Trzy dni | 70 % | 53 % |
| Odległość od progu | 6 punktów | 8 punktów |
Sześć punktów w rachunku najsurowszym, osiem w surowym. Tak czy inaczej lista sprzed trzech dni przypomina dzisiejszą mniej więcej tak samo, jak dwa uruchomienia wykonane w tej samej minucie.
I tu oba silniki przestają być do siebie podobne
| Silnik | Ten sam dzień | Trzy dni | Odległość |
|---|---|---|---|
| Perplexity | 85 % | 71 % | 14 punktów |
| Gemini | 68 % | 69 % | żadna |
Gemini w ogóle nie dryfuje. Trzy dni później jego lista przypomina dzisiejszą dokładnie tak samo, jak dwie jego własne kolejne odpowiedzi. To nie stabilność: on jest już tak mało zgodny sam ze sobą - 68 % między kolejnymi uruchomieniami - że trzy dni nie mają już nic do dodania.
Perplexity jest odwrotnością. Powtarza się dobrze w krótkim okresie, 85 %, i właśnie dlatego prawdziwy dryf staje się widoczny: 14 punktów w trzy dni. Tam pomiar w odstępie tygodnia ma sens, bo szum nie zagłusza sygnału.
W jednym silniku pytanie „jak często mierzyć?” ma odpowiedź. W drugim się nie pojawia, bo tam pojedyncze uruchomienie już nic nie znaczy.
Sześć przeciw czterdziestu sześciu
Liczba nabiera sensu dopiero obok wczorajszej, uzyskanej w tym samym układzie, przy tym samym progu i tym samym czyszczeniu.
| Co się zmienia | Koszt w punktach |
|---|---|
| Dzień, w którym się pyta (3 dni) | 6 |
| Cena jako kryterium („najlepszy stosunek jakości do ceny”) | 24 |
| Poziom („jestem początkujący”) | 37 |
| Kontekst („moja 10-osobowa firma”) | 46 |
Siedem razy więcej. Audyt powtarzający codziennie to samo sformułowanie mierzy, bardzo precyzyjnie, jedną ósmą tematu. Budżet pomiarowy lepiej ulokować w różnorodności pytań niż w ich częstotliwości.
Co z tego wyciągamy dla własnego produktu
Codzienny pomiar nie ma na tym etapie uzasadnienia.
Przez trzy dni różnica mieści się w szumie. Nie będziemy sprzedawać częstotliwości, której nasze własne liczby nie potwierdzają.
Pojedynczy pomiar pozostaje bezużyteczny
, i to druga strona tego samego wyniku: przy 68 % pokrycia między kolejnymi odpowiedziami jedno uruchomienie w Gemini niczego nie ustala. Powtarzanie służy uciszeniu szumu, nie śledzeniu bieżących wydarzeń.
Użyteczna częstotliwość zależy od silnika.
W Perplexity prawdziwy dryf widać po trzech dniach. W Gemini najpierw trzeba kilku uruchomień, żeby wiedzieć, o czym mowa.
Dźwignią jest różnorodność pytań.
Tam leży 46 punktów, wobec 6 dla kalendarza.
Ograniczenia i utrata danych z naszej winy
Zniszczyliśmy własne dane z 26 sierpnia. Skrypt analityczny zaimportował funkcję z kolektora z poprzedniego dnia; ten kolektor wykonywał swój pomiar przy ładowaniu modułu i nadpisał swój plik wyjściowy. 120 uruchomień zredukowanych do 12, bez kopii. Porównania po jednym i dwóch dniach, które ten artykuł miał zawierać, są więc niemierzalne: pomiaru minionego dnia nie da się powtórzyć. Zostają próg dnia i różnica po trzech dniach. Dodano zabezpieczenie, by import niczego już nie uruchamiał.
Dwa punkty w czasie, nie krzywa.
Sześć punktów po trzech dniach nic nie mówi o tym, jak dryf zachowuje się po tygodniu czy miesiącu. Nie ekstrapolujemy.
Cztery branże, dwa języki, dwa silniki.
Buty do biegania są wyłączone: odpowiedzi cytują tam numerowane modele, które nasz ekstraktor odrzuca, przez co branża wychodziła wszędzie na 0 % - artefakt filtra, nie wynik.
Nasz ekstraktor pozostaje niedoskonały.
Dlatego oba poziomy czyszczenia publikujemy obok siebie: wniosek broni się w obu albo nie ma wniosku.
Spokojny okres pozostaje spokojnym okresem.
W ciągu tych trzech dni w badanych branżach nie było ani dużej premiery, ani ogłoszonej zmiany modelu. Słaby dryf w spokoju niczego nie obiecuje w burzy.
Nikomu nie obiecujemy miejsca w odpowiedziach ChatGPT - nikt nie może tego zrobić uczciwie. Mierzalne jest to, gdzie jesteś: w podziale na języki, silniki i zadane pytanie. A teraz również z pewnym pojęciem o tym, co robi z tym czas.