Czy cytowane źródła naprawdę wyjaśniają rekomendację? 128 sprawdzonych po kolei
Przeczytaliśmy strony, które AI podaje jako źródła, i szukaliśmy w nich rekomendowanej marki. 128 marek na 128, z medianą sześciu stron cytujących każdą.
W tym artykule
Krótka odpowiedź: tak. Spośród 128 firm rekomendowanych przez Perplexity wszystkie 128 pojawiają się na co najmniej jednej ze stron, które silnik podaje jako odwiedzone. Mediana to sześć stron cytujących na dwanaście zbadanych źródeł. Cytaty nie są dekoracją: naprawdę niosą odpowiedź.
Ten artykuł istnieje, bo wczorajszy kończył się zastrzeżeniem, które sami napisaliśmy: „mierzymy to, co czytane, a nie to, co przekonało”. Cytowana strona niekoniecznie jest tą, która wprowadziła nazwę na listę. Pozwolić własnemu zastrzeżeniu spać to zamienić je w ozdobnik stylistyczny. Da się je rozstrzygnąć, więc je rozstrzygnęliśmy.
Gdyby źródła nie wyjaśniały rekomendacji, wszystko, co publikujemy od trzech dni o tym, gdzie dać się cytować, byłoby radą bez podstaw. To rodzaj sprawdzenia, które lepiej przeprowadzić na sobie.
Co dokładnie zmierzyliśmy
Wychodzimy od odpowiedzi zebranych 24 sierpnia - pięć globalnych branż, bez wymieniania żadnego kraju. Z każdej mamy dwie rzeczy: tekst, czyli rekomendowane firmy, oraz cytowane adresy URL. Zostaje przeczytać te strony i sprawdzić, czy rekomendowana nazwa się w nich znajduje.
Pułapka decyduje o wszystkim i jest brutalna. Strona, której nie udało się przeczytać - odmowa dostępu, przekroczony czas, treść budowana w JavaScripcie - sprawiłaby, że marka wyglądałaby na „niepotwierdzoną”, choć być może jest potwierdzona. Fabrykowalibyśmy najbardziej efektowny wynik artykułu z własnych niepowodzeń zbierania. Dlatego sklasyfikowaliśmy w trzy stany, nigdy w dwa:
| Stan | Znaczenie |
|---|---|
| Potwierdzona | marka pojawia się na co najmniej jednej cytowanej stronie |
| Niepotwierdzona | wszystkie cytowane strony przeczytane, marki tam nie ma |
| Nierozstrzygnięta | co najmniej jedna cytowana strona pozostała nieczytelna |
Publikowany wskaźnik liczony jest wyłącznie na przypadkach rozstrzygniętych, a udział nierozstrzygniętych publikujemy obok: 254 z 300 cytowanych stron udało się przeczytać, czyli 85 %. Przedstawiamy się jako robot i nie udajemy przeglądarki - strona, która odmawia robotom, ma prawo nam odmówić, a to liczy się jako „nieczytelne”, nie jako fakt.
Wynik
| Werdykt | Liczba |
|---|---|
| Potwierdzona przez co najmniej jedną cytowaną stronę | 128 |
| Niepotwierdzona | 0 |
| Nierozstrzygnięta (strona nieczytelna) | 6 |
| Wskaźnik na przypadkach rozstrzygniętych | 100 % |
A potwierdzenie nie jest wątłe. Mediana rekomendowanej marki pojawia się na sześciu z dwunastu zbadanych stron, przy średniej 5,9. To nie zbieg okoliczności słownictwa: to zbieżność.
Dziewięć procent, które wisi na jednej stronie
11 marek na 128 jest potwierdzonych przez dokładnie JEDNĄ cytowaną stronę. To najbardziej praktyczna liczba w tym pomiarze i czyta się ją w dwie strony.
Jako dźwignia: w tych przypadkach jedna strona wystarczyła, by wprowadzić nazwę do odpowiedzi. Krajowa porównywarka, artykuł prasy branżowej, wpis na lokalnej platformie - jedna strona i firma istnieje dla asystenta. To czyni strategię źródeł konkretną, a nie zaklinającą.
Jako kruchość: jeśli cytuje cię jedna strona, twoja obecność zależy od niej. Ta strona zmienia pozycję, znika albo przestaje być czytana - i znikasz z odpowiedzi, choć u ciebie nic się nie zmieniło.
Co ten wynik pozwala powiedzieć, a czego nie
Pozwala powiedzieć, że lista źródeł jest realną dźwignią. Skoro rekomendacje są faktycznie niesione przez to, co silnik przeczytał, i skoro - to był pomiar z poprzedniego dnia - te strony są krajowe, nieliczne i możliwe do wskazania dla każdej branży i języka, to praca nad pojawieniem się na nich działa na przyczynę, a nie na objaw.
Nie pozwala powiedzieć, że pojawienie się na stronie wystarczy, by być rekomendowanym. Pokazaliśmy, że każda rekomendacja opiera się na źródle; nie pokazaliśmy, że każde źródło produkuje rekomendację. Cytowane strony wymieniają znacznie więcej firm, niż silnik zachowuje. Bycie tam jest warunkiem, nie przepustką.
Każda rekomendacja opiera się na przeczytanej stronie. Nie każda przeczytana strona produkuje rekomendację. Mylenie tych dwóch rzeczy byłoby sprzedawaniem mrzonek.
Usterka znaleziona u nas, nie u nich
Ten sam pomiar ujawnił problem w naszym narzędziu. Nasz ekstraktor nazw zwracał 200 wpisów; 66, czyli jedna trzecia, nie było nazwami firm - etykiety rankingowe sklejone ze znacznikami cytowań, jak `Best overall: HubSpot CRM[2][3][4][6]`, albo początki porad („Dla większości ludzi”).
Odrzuciliśmy te 66 przed obliczeniem i dlatego artykuł mówi o 128 markach, a nie o 200. Szczegół, który się liczy: jedyne pięć „niepotwierdzonych” w pomiarze surowym było w całości artefaktami tego rodzaju - żadna nie była bezpodstawną rekomendacją. Poprawka czeka w kolejce. Mówimy o tym tutaj, bo liczba, której czyszczenie się ukrywa, nie jest liczbą.
Ograniczenia
Jeden silnik.
Perplexity jako jedyny z trzech zwraca użyteczne adresy URL. Gemini ukrywa swoje za przekierowaniami, a ChatGPT odpytywany przez API w ogóle nie szuka. Ten wynik dotyczy silnika, który szuka, a nie „AI” w ogólności.
Pięć języków.
Angielski, francuski, portugalski, hiszpański, niemiecki - te, w których nasz ekstraktor nazw jest zweryfikowany. Po japońsku, koreańsku, polsku i arabsku wciąż zwraca nagłówki sekcji; mierzenie trafności cytowania ekstraktorem, który myli nazwę, dałoby szum podany jako wynik.
Jeden dzień
, a asystenci nie są deterministyczni: dwa uruchomienia tego samego angielskiego promptu pokrywają się tylko w 62-76 %.
Obecność to nie przyczyna.
Nazwa jest na cytowanej stronie - to nie dowodzi, że właśnie ta strona zadecydowała. Zawęziliśmy wczorajsze pytanie, nie rozpuściliśmy go.
Nikomu nie obiecujemy miejsca w odpowiedziach ChatGPT - nikt nie może tego zrobić uczciwie. Mierzalne jest to, gdzie jesteś, w podziale na języki i silniki, oraz na jakich stronach ten stan się opiera.