사흘 뒤에도 추천 목록은 거의 그대로였다 - 6포인트, 질문을 바꾸면 46포인트
우리는 반복 측정을 판다. 그래서 목록이 날마다 바뀌는지 검증했다. 거의 바뀌지 않았고, 한 엔진에서는 전혀 바뀌지 않았다.
짧은 답: 언제 묻는지는 거의 아무것도 바꾸지 않는다. 어떻게 묻는지가 모든 것을 바꾼다. 사흘 간격으로 같은 질문을 하면 겹침은 70 %, 몇 분 간격으로 두 번 물으면 76 %다. 차이는 6포인트. 어제 측정에서는 구매 맥락을 바꾸는 것만으로 46포인트였다.
우리는 반복 측정을 판다. 「자주 측정해야 한다」고 결론짓는 편이 우리에게 유리하다. 바로 그래서 이 질문은 불편한 답을 미리 받아들일 각오로, 제대로 세워야 했다.
목록을 움직이는 것은 달력이 아니다. 질문이고, 엔진이다.
무엇을 측정했는가
8월 23일 이후 우리의 모든 측정이 사용해 온 같은 기준 질문 - 한 글자도 다르지 않음을 가정이 아니라 확인했다. 전 세계적인 4개 분야, 2개 언어, 검색하는 두 어시스턴트. 오늘 60회 실행, 실패 0건. 여기에 사흘 전 비교 지점으로 보관해 둔 8월 24일 수집을 더한다.
잡음 하한은 여전히 이 글을 떠받치는 기둥이다. 어시스턴트는 몇 분 간격에서도 이미 자기 자신과 어긋난다. 이틀 사이의 차이는, 우연이 몇 분 만에 만들어내는 차이와 견주기 전까지 아무 의미가 없다. 그래서 오늘도 세 번 뽑아, 그저께의 하한을 들여오지 않고 그날 자신의 하한을 얻었다.
결과
| 두 실행 사이의 간격 | 정제 | 원자료 |
|---|---|---|
| 같은 날, 몇 분 간격(하한) | 76 % | 61 % |
| 사흘 | 70 % | 53 % |
| 하한과의 거리 | 6포인트 | 8포인트 |
가장 엄격한 계산으로 6포인트, 원자료로 8포인트. 어느 쪽이든 사흘 전 목록은 같은 1분 안에 뽑은 두 결과만큼이나 오늘의 목록과 닮았다.
그리고 여기서 두 엔진은 닮기를 멈춘다
| 엔진 | 같은 날 | 사흘 뒤 | 거리 |
|---|---|---|---|
| Perplexity | 85 % | 71 % | 14포인트 |
| Gemini | 68 % | 69 % | 없음 |
Gemini는 전혀 움직이지 않는다. 사흘 뒤 목록은 자기 자신의 연속된 두 답변과 정확히 같은 정도로 오늘의 목록과 닮았다. 이것은 안정이 아니다. 연속된 두 실행에서 이미 68 %밖에 일치하지 않을 만큼 자기와 어긋나 있어, 사흘이 더할 것이 남지 않은 것이다.
Perplexity는 그 반대다. 단기 재현성이 높아 85 %이고, 바로 그 때문에 진짜 변화가 보인다 - 사흘에 14포인트. 여기서는 일주일 간격의 측정에 의미가 있다. 잡음이 신호를 삼키지 않기 때문이다.
한 엔진에서는 「얼마나 자주 측정할 것인가」에 답이 있다. 다른 엔진에서는 그 물음이 서지 않는다. 거기서는 한 번의 실행이 이미 아무것도 뜻하지 않기 때문이다.
6 대 46
이 숫자는 같은 설계, 같은 하한, 같은 정제로 얻은 어제의 숫자와 나란히 놓을 때 비로소 뜻을 갖는다.
| 바꾸는 것 | 비용(포인트) |
|---|---|
| 묻는 날짜(3일) | 6 |
| 가격을 기준으로(「가성비가 가장 좋은 것」) | 24 |
| 숙련도(「초보입니다」) | 37 |
| 맥락(「10명 규모 회사입니다」) | 46 |
일곱 배다. 날마다 같은 표현을 되풀이하는 진단은 이 주제의 정확히 8분의 1을 매우 정밀하게 측정한다. 측정 예산은 빈도보다 질문의 다양성에 두는 편이 낫다.
우리 제품에 대해 여기서 끌어내는 것
현 단계에서 매일 측정할 근거는 없다.
사흘 동안 차이는 잡음 안에 머문다. 우리 자신의 숫자가 뒷받침하지 않는 주기를 팔지는 않겠다.
단발 측정은 여전히 쓸 수 없다.
이는 같은 결과의 뒷면이다. 연속된 답변끼리 68 %만 겹치는 이상, Gemini에서의 한 번 실행은 아무것도 확립하지 못한다. 반복은 잡음을 잠재우기 위한 것이지 시사를 좇기 위한 것이 아니다.
유용한 주기는 엔진에 따라 다르다.
Perplexity에서는 사흘이면 진짜 변화가 나타난다. Gemini에서는 먼저 여러 번 뽑아야 무엇을 보고 있는지 알 수 있다.
지렛대는 질문의 다양성이다.
거기에 46포인트가 있고, 달력에는 6포인트뿐이다.
한계, 그리고 우리 자신이 초래한 데이터 손실
우리는 8월 26일 우리 자신의 데이터를 파괴했다. 분석 스크립트가 전날 수집 스크립트에서 함수를 가져왔는데, 그 수집 스크립트는 모듈을 불러오는 시점에 측정을 실행하며 자기 출력 파일을 덮어썼다. 120회 실행이 12건으로 줄었고, 사본은 없었다. 이 글이 담기로 했던 하루와 이틀 비교는 따라서 측정 불가능하다 - 지나간 날의 측정은 다시 할 수 없다. 남은 것은 그날의 하한과 사흘의 차이뿐이다. 불러오기가 아무것도 실행하지 않도록 방어 장치를 넣었다.
시간상 두 점이지 곡선이 아니다.
사흘에 6포인트라는 사실은 일주일이나 한 달 뒤 변화가 어떻게 움직이는지 아무것도 말해 주지 않는다. 외삽하지 않는다.
4개 분야, 2개 언어, 2개 엔진.
러닝화는 제외했다. 이 분야의 답변은 번호가 붙은 모델명을 인용하는데 우리 추출기가 그것을 버려, 어디서나 0 %로 나왔다 - 필터의 부산물이지 결과가 아니다.
우리 추출기는 여전히 불완전하다.
그래서 두 단계의 정제를 나란히 공개한다. 결론이 둘 다에서 성립하지 않으면 결론이 아니다.
조용한 시기는 조용한 시기일 뿐이다.
이 사흘 동안 검증한 분야에 큰 출시도, 공표된 모델 변경도 없었다. 잔잔할 때의 작은 변화는 거칠 때에 대해 아무것도 약속하지 않는다.
우리는 누구에게도 ChatGPT 답변에서의 자리를 약속하지 않는다 - 정직하게 그렇게 할 수 있는 곳은 없다. 측정할 수 있는 것은 언어별, 엔진별, 던져진 질문별로 지금 어디에 있는지다. 그리고 이제부터는 시간이 그것에 무엇을 하는지에 대한 단서도 함께.