134 błędne odpowiedzi na 200, 15 wyrażonych wątpliwości: być cytowanym to nie to samo co być cytowanym poprawnie
Dwa duże badania zmierzyły cytowania silników AI. Ponad 60% jest błędnych, 31% ma problem ze źródłem, a pewność siebie nigdy nie spada. Co to zmienia dla marki.
ponad 60%
cytowań błędnych na 1600 zapytań, osiem przetestowanych silników (Tow Center, marzec 2025)
W tym artykule
Krótka odpowiedź: cytowanie przez AI może wymienić Twoją nazwę i pomylić się co do Ciebie. Opublikowane pomiary nie dotyczą pojawiania się, lecz trafności tego, co zostaje przypisane: ponad 60% błędnych cytowań w badaniu 1600 zapytań, 31% z problemami źródłowymi w innym, obejmującym ponad 3000 odpowiedzi. Użyteczne pytanie brzmi więc nie tylko « czy jestem cytowany », ale « czy to, co każe mi się mówić, jest prawdą, i czy odnośnik gdziekolwiek prowadzi ».
31%
odpowiedzi z problemem źródła: brakujące, mylące lub błędne przypisanie (EBU i BBC, październik 2025)
134 wobec 15
artykułów źle zidentyfikowanych przez ChatGPT, wobec liczby zgłoszonych wątpliwości, na 200 odpowiedzi
Silnik, który się myli i to mówi, zostawia Ci szansę. Silnik, który myli się z pewnością siebie, nie zostawia żadnej: czytelnik nie ma powodu, by sprawdzać.
Co zmierzyły dwa duże badania
Pierwsze pochodzi z Tow Center for Digital Journalism na Columbii, opublikowane 6 marca 2025. Protokół jest prosty i odtwarzalny: dwudziestu wydawców, po dziesięć artykułów wylosowanych u każdego, fragmenty skopiowane dosłownie i osiem silników odpowiedzi, które mają wskazać tytuł, wydawcę źródłowego, datę i URL. To 1600 zapytań. Łącznie silniki udzieliły błędnej odpowiedzi na ponad 60% z nich.
| Pomiar | Wynik |
|---|---|
| Wszystkie osiem silników razem | ponad 60% błędnych odpowiedzi |
| Perplexity, najlepszy w zestawieniu | 37% błędnych |
| Grok-3, najgorszy w zestawieniu | 94% błędnych |
| Grok-3, cytowania prowadzące na stronę błędu | 154 na 200 |
Drugie jest szersze i pochodzi od mediów publicznych. Opublikowane 22 października 2025 przez Europejską Unię Nadawców wraz z BBC, kazało zawodowym dziennikarzom ocenić ponad 3000 odpowiedzi ChatGPT, Copilota, Gemini i Perplexity, w 22 organizacjach, 18 krajach i 14 językach. Jego główny wniosek: wada jest systemowa - nie zależy ani od języka, ani od rynku, ani od konkretnego asystenta.
| Rodzaj wady | Udział odpowiedzi |
|---|---|
| Co najmniej jeden istotny problem | 45% |
| Problem źródła: brakujące, mylące lub błędne przypisanie | 31% |
| Poważny problem trafności: zmyślone szczegóły, nieaktualna informacja | 20% |
| Gemini, odpowiedzi z istotnym problemem | 76% |
Najgorszy nie jest błąd, lecz pewność siebie
Jedna liczba z Tow Center zasługuje na wyodrębnienie, bo rozstrzyga o całej reszcie. ChatGPT źle zidentyfikował 134 artykuły na 200, a brak pewności zgłosił tylko piętnaście razy. Błąd i wątpliwość nie są skorelowane: silnik myli się w dwóch trzecich przypadków i mówi o tym w jednym na trzynaście.
To różnica między źródłem omylnym a źródłem mylącym. Silnik, który się waha, zostawia czytelnikowi sygnał, a więc szansę sprawdzenia. Silnik, który twierdzi, nie zostawia nic. Dla firmy znaczy to, że błędne cytowanie nie poprawi się samo: nic w odpowiedzi nie zachęca nikogo, by w nie zwątpić.
Odnośniki prowadzące donikąd
Drugie ustalenie jest jeszcze bardziej namacalne. Ponad połowa odpowiedzi Gemini i Grok-3 odsyłała do zmyślonych lub martwych adresów URL. W Grok-3 154 cytowania na 200 kończyły się na stronie błędu. Silnik nie tylko źle przypisuje: wymyśla adres wyglądający jak dowód.
Badanie EBU opisuje tę samą mechanikę po stronie źródeł: twierdzenia przypisane redakcjom, które nigdy ich nie sformułowały, odnośniki prowadzące do artykułu o czym innym albo do strony, która zniknęła, a czasem pełne cytowanie - nazwa medium, tytuł, data - artykułu, który nigdy nie powstał. Dobrze uformowany przypis nie jest przypisem prawdziwym.
Co to zmienia dla marki
Rozumowanie przenosi się wprost. Jeśli silnik potrafi przypisać zdanie redakcji, która go nie napisała, potrafi przypisać Twój argument, Twoją cenę czy Twoją specjalność konkurentowi - albo odwrotnie, przypisać Ci obietnicę, której nigdy nie złożyłeś. W obu przypadkach jesteś « cytowany », i w obu licznik, który tylko liczy cytowania, pokazuje dobrą wiadomość.
To granica wyniku widoczności branego osobno, także naszego. Pojawienie się jest warunkiem koniecznym, nie jest miarą rezultatu. Cytowanie czyta się trzema pytaniami: czy nas wymieniono, czy to, co nam przypisano, jest trafne, i czy proponowany odnośnik prowadzi do strony, która istnieje.
Te badania dotyczą wiadomości, nie rekomendacji firm.
Protokół Tow Center polega na odnalezieniu źródła fragmentu prasowego; protokół EBU każe dziennikarzom oceniać odpowiedzi na tematy bieżące. Mechanizm przypisania jest ten sam, ale przeniesienie na rekomendacje handlowe jest nasze i nie zostało przez te prace zmierzone.
Pochodzą z 2025 roku, a modele od tego czasu się zmieniły.
Tow Center opublikowało w marcu 2025, EBU i BBC w październiku 2025. Testowane wersje nie są już tymi serwowanymi dziś, a żaden z tych pomiarów nie mówi, co dałby ten sam protokół w tym miesiącu. Nie powtórzyliśmy go.
Średnia z ośmiu silników ukrywa ogromne różnice.
Od 37% do 94% błędów zależnie od silnika, globalne « ponad 60% » to średnia, którą podnosi najgorszy. Cytowanie tej jednej liczby dla opisania konkretnego silnika byłoby błędem odczytu.
Nie odtworzyliśmy żadnego z nich.
To prace opublikowane przez uniwersytecki ośrodek badawczy i przez konsorcjum mediów publicznych, przeczytane u źródła. To nie są nasze pomiary i nie przedstawiamy ich jako takie.
Co to zmienia
Czytaj cytowanie, nie tylko licznik.
Być wymienionym i być dobrze opisanym to dwa różne wyniki. Pulpit liczący same wystąpienia nie odróżni dobrej wiadomości od błędu na Twój temat.
Sprawdź, czy odnośnik istnieje.
Zmyślony adres w Twojej domenie wygląda jak dowód, a nim nie jest. Kliknij to, co proponuje silnik: połowa odpowiedzi dwóch testowanych silników prowadziła na martwą stronę.
Pilnuj tego, co przypisuje się Twoim konkurentom.
Błąd działa w obie strony: Twój argument może zostać zapisany na konto innej nazwy, a tego nie widać z monitoringu, który patrzy tylko na Twoją.
Nie licz na wątpliwość silnika.
Myli się znacznie częściej, niż się waha - 134 błędy wobec 15 zastrzeżeń na 200 odpowiedzi. Pewność tonu nic nie mówi o trafności treści.