본문으로 건너뛰기
Waseit
← 모든 글
AEOGEO

사흘 뒤에도 추천 목록은 거의 그대로였다 - 6포인트, 질문을 바꾸면 46포인트

우리는 반복 측정을 판다. 그래서 목록이 날마다 바뀌는지 검증했다. 거의 바뀌지 않았고, 한 엔진에서는 전혀 바뀌지 않았다.

2026년 8월 27일9 분 소요
이 글의 목차
  1. 무엇을 측정했는가
  2. 결과
  3. 그리고 여기서 두 엔진은 닮기를 멈춘다
  4. 6 대 46
  5. 우리 제품에 대해 여기서 끌어내는 것
  6. 한계, 그리고 우리 자신이 초래한 데이터 손실

짧은 답: 언제 묻는지는 거의 아무것도 바꾸지 않는다. 어떻게 묻는지가 모든 것을 바꾼다. 사흘 간격으로 같은 질문을 하면 겹침은 70 %, 몇 분 간격으로 두 번 물으면 76 %다. 차이는 6포인트. 어제 측정에서는 구매 맥락을 바꾸는 것만으로 46포인트였다.

우리는 반복 측정을 판다. 「자주 측정해야 한다」고 결론짓는 편이 우리에게 유리하다. 바로 그래서 이 질문은 불편한 답을 미리 받아들일 각오로, 제대로 세워야 했다.

목록을 움직이는 것은 달력이 아니다. 질문이고, 엔진이다.

무엇을 측정했는가

8월 23일 이후 우리의 모든 측정이 사용해 온 같은 기준 질문 - 한 글자도 다르지 않음을 가정이 아니라 확인했다. 전 세계적인 4개 분야, 2개 언어, 검색하는 두 어시스턴트. 오늘 60회 실행, 실패 0건. 여기에 사흘 전 비교 지점으로 보관해 둔 8월 24일 수집을 더한다.

잡음 하한은 여전히 이 글을 떠받치는 기둥이다. 어시스턴트는 몇 분 간격에서도 이미 자기 자신과 어긋난다. 이틀 사이의 차이는, 우연이 몇 분 만에 만들어내는 차이와 견주기 전까지 아무 의미가 없다. 그래서 오늘도 세 번 뽑아, 그저께의 하한을 들여오지 않고 그날 자신의 하한을 얻었다.

결과

추천 목록의 겹침. 4개 분야, 영어와 프랑스어, Perplexity와 Gemini, 2026-08-27. 「정제」는 여러 답변에 되풀이 등장하는 이름만 남긴 계산이고, 「원자료」는 그 옆에 두어 정제가 무엇을 바꾸는지 독자가 볼 수 있게 했다.
두 실행 사이의 간격정제원자료
같은 날, 몇 분 간격(하한)76 %61 %
사흘70 %53 %
하한과의 거리6포인트8포인트

가장 엄격한 계산으로 6포인트, 원자료로 8포인트. 어느 쪽이든 사흘 전 목록은 같은 1분 안에 뽑은 두 결과만큼이나 오늘의 목록과 닮았다.

그리고 여기서 두 엔진은 닮기를 멈춘다

같은 계산을 엔진별로. 둘의 평균을 내면 한쪽에 다른 쪽의 안정성을 빌려주게 된다.
엔진같은 날사흘 뒤거리
Perplexity85 %71 %14포인트
Gemini68 %69 %없음

Gemini는 전혀 움직이지 않는다. 사흘 뒤 목록은 자기 자신의 연속된 두 답변과 정확히 같은 정도로 오늘의 목록과 닮았다. 이것은 안정이 아니다. 연속된 두 실행에서 이미 68 %밖에 일치하지 않을 만큼 자기와 어긋나 있어, 사흘이 더할 것이 남지 않은 것이다.

Perplexity는 그 반대다. 단기 재현성이 높아 85 %이고, 바로 그 때문에 진짜 변화가 보인다 - 사흘에 14포인트. 여기서는 일주일 간격의 측정에 의미가 있다. 잡음이 신호를 삼키지 않기 때문이다.

한 엔진에서는 「얼마나 자주 측정할 것인가」에 답이 있다. 다른 엔진에서는 그 물음이 서지 않는다. 거기서는 한 번의 실행이 이미 아무것도 뜻하지 않기 때문이다.

6 대 46

이 숫자는 같은 설계, 같은 하한, 같은 정제로 얻은 어제의 숫자와 나란히 놓을 때 비로소 뜻을 갖는다.

추천 목록을 움직이는 것, 잡음 하한 아래로의 거리(포인트). 두 번의 측정, 연속된 이틀, 하나의 방법.
바꾸는 것비용(포인트)
묻는 날짜(3일)6
가격을 기준으로(「가성비가 가장 좋은 것」)24
숙련도(「초보입니다」)37
맥락(「10명 규모 회사입니다」)46

일곱 배다. 날마다 같은 표현을 되풀이하는 진단은 이 주제의 정확히 8분의 1을 매우 정밀하게 측정한다. 측정 예산은 빈도보다 질문의 다양성에 두는 편이 낫다.

우리 제품에 대해 여기서 끌어내는 것

현 단계에서 매일 측정할 근거는 없다.

사흘 동안 차이는 잡음 안에 머문다. 우리 자신의 숫자가 뒷받침하지 않는 주기를 팔지는 않겠다.

단발 측정은 여전히 쓸 수 없다.

이는 같은 결과의 뒷면이다. 연속된 답변끼리 68 %만 겹치는 이상, Gemini에서의 한 번 실행은 아무것도 확립하지 못한다. 반복은 잡음을 잠재우기 위한 것이지 시사를 좇기 위한 것이 아니다.

유용한 주기는 엔진에 따라 다르다.

Perplexity에서는 사흘이면 진짜 변화가 나타난다. Gemini에서는 먼저 여러 번 뽑아야 무엇을 보고 있는지 알 수 있다.

지렛대는 질문의 다양성이다.

거기에 46포인트가 있고, 달력에는 6포인트뿐이다.

한계, 그리고 우리 자신이 초래한 데이터 손실

우리는 8월 26일 우리 자신의 데이터를 파괴했다. 분석 스크립트가 전날 수집 스크립트에서 함수를 가져왔는데, 그 수집 스크립트는 모듈을 불러오는 시점에 측정을 실행하며 자기 출력 파일을 덮어썼다. 120회 실행이 12건으로 줄었고, 사본은 없었다. 이 글이 담기로 했던 하루이틀 비교는 따라서 측정 불가능하다 - 지나간 날의 측정은 다시 할 수 없다. 남은 것은 그날의 하한과 사흘의 차이뿐이다. 불러오기가 아무것도 실행하지 않도록 방어 장치를 넣었다.

시간상 두 점이지 곡선이 아니다.

사흘에 6포인트라는 사실은 일주일이나 한 달 뒤 변화가 어떻게 움직이는지 아무것도 말해 주지 않는다. 외삽하지 않는다.

4개 분야, 2개 언어, 2개 엔진.

러닝화는 제외했다. 이 분야의 답변은 번호가 붙은 모델명을 인용하는데 우리 추출기가 그것을 버려, 어디서나 0 %로 나왔다 - 필터의 부산물이지 결과가 아니다.

우리 추출기는 여전히 불완전하다.

그래서 두 단계의 정제를 나란히 공개한다. 결론이 둘 다에서 성립하지 않으면 결론이 아니다.

조용한 시기는 조용한 시기일 뿐이다.

이 사흘 동안 검증한 분야에 큰 출시도, 공표된 모델 변경도 없었다. 잔잔할 때의 작은 변화는 거칠 때에 대해 아무것도 약속하지 않는다.

우리는 누구에게도 ChatGPT 답변에서의 자리를 약속하지 않는다 - 정직하게 그렇게 할 수 있는 곳은 없다. 측정할 수 있는 것은 언어별, 엔진별, 던져진 질문별로 지금 어디에 있는지다. 그리고 이제부터는 시간이 그것에 무엇을 하는지에 대한 단서도 함께.

자주 묻는 질문

AI 가시성은 얼마나 자주 측정해야 하나요?
2026년 8월 27일 우리 측정에 따르면 생각보다 덜 자주 해도 됩니다. 사흘 간격이면 추천 목록의 겹침은 70 %, 몇 분 간격의 두 실행에서는 76 %로 차이가 6포인트에 불과합니다. 측정 예산은 빈도보다 던지는 질문의 다양성에 두는 편이 낫습니다.
AI가 추천하는 기업 목록은 날마다 바뀌나요?
사흘 동안은 아주 조금이며, 엔진에 따라 다릅니다. 단기 재현성이 높은 Perplexity(85 %)는 사흘에 14포인트의 실제 변화를 보입니다. Gemini는 변화를 보이지 않습니다 - 안정적이어서가 아니라, 연속된 답변끼리 68 %밖에 일치하지 않을 만큼 이미 들쭉날쭉해 사흘이 더할 것이 없기 때문입니다.
AI의 추천을 가장 크게 움직이는 것은 무엇인가요?
달력이 아니라 질문입니다. 구매 맥락을 바꾸는 것 - 「최고의 X는」 대 「10명 회사에는 어느 것」 - 은 겹침을 46포인트 떨어뜨립니다. 사흘을 기다리는 비용은 6포인트입니다. 연속된 이틀, 같은 설계로 측정한 7대 1의 비입니다.
한 번의 진단으로 AI가 나를 추천하는지 알 수 있나요?
아닙니다. 같은 질문에 대한 연속된 두 답변은 Gemini에서 68 %, Perplexity에서 85 %만 겹칩니다. 한 번의 실행으로는 진짜 변화와 그날의 우연을 구분할 수 없습니다. 반복은 무엇보다 그 잡음을 잠재우기 위한 것입니다.
매일 측정에 반하는 결과를 왜 공개하나요?
우리가 반복 측정을 팔고 있고, 파는 쪽에 맞춰 고른 숫자는 아무 가치가 없기 때문입니다. 질문은 잡음 하한과 두 단계의 정제를 갖춰 제대로 세웠고, 답은 나온 그대로 공개합니다.