본문으로 건너뛰기
Waseit
← 모든 글
AEOGEO

같은 필요를 다르게 물으면 다른 기업이 나옵니다 - 겹침은 31 %

「최고의 X」와 「10명 회사에는 어느 것」의 추천 목록은 31 %만 겹칩니다. 똑같은 질문을 두 번 했을 때의 77 %에 비해서요.

2026년 8월 26일10 분 소요
이 글의 목차
  1. 왜 지금 이 질문인가
  2. 정확히 무엇을 측정했는가
  3. 잡음 하한 - 이것이 없으면 이 글은 존재하지 않습니다
  4. 결과
  5. 이것을 구체적으로 만드는 사례
  6. 경쟁 가설을 검증하고 기각했습니다
  7. 무엇을 할 것인가
  8. 한계

짧은 답: 질문 속의 구매 맥락을 바꾸면 추천되는 기업이 바뀝니다. 그것도 어시스턴트 자신의 무작위성보다 훨씬 크게 바뀝니다. 똑같은 질문을 두 번 하면 목록은 77 % 겹칩니다. 「최고의 X는」 대신 「10명 회사에는 어느 것」이라고 물으면 31 %입니다.

잡음 하한보다 46포인트 아래입니다. 달리 말하면, 당신의 구매자가 필요를 어떻게 표현하느냐가, 어시스턴트가 알아서 흔드는 모든 것보다 당신의 존재에 더 무겁게 작용합니다.

하나의 표현만 묻는 가시성 진단은 당신의 시장을 측정하지 않습니다. 그 4분의 1을 측정합니다.

왜 지금 이 질문인가

우리는 언어가 추천 목록을 바꾸고, 읽히는 출처도 그와 함께 바뀌며, 그 출처가 실제로 추천을 떠받친다는 것을 보여왔습니다. 남은 것은 기업이 가장 의심하지 않는 변수입니다 - 전혀 통제할 수 없기 때문입니다. 고객이 요구를 어떻게 표현하는가.

아무도 「최고의 CRM」만 입력하지는 않습니다. 구매자는 「작은 조직을 운영합니다」, 「가성비가 가장 좋은 것은」, 「초보인데 가장 간단한 것은」이라고도 말합니다. 이는 네 개의 구매 국면이지, 같은 말의 네 가지 표현이 아닙니다.

정확히 무엇을 측정했는가

전 세계적인 5개 분야, 2개 언어(영어·프랑스어), 검색하는 두 어시스턴트 - Perplexity와 Gemini. 120회 실행, 실패 0건. 기준 질문은 이전 측정에서 한 글자도 바꾸지 않고 가져왔습니다. 그래서 이 측정은 앞선 것들과 나란히 읽을 수 있습니다.

네 개의 구매 국면이지, 네 가지 바꿔 말하기가 아닙니다.
의도질문 문장
기준「최고의 X는 무엇인가요?」
작은 회사「10명 규모 회사를 운영합니다. 어떤 X를 추천하시나요?」
가격「어떤 X가 가성비가 가장 좋은가요?」
초보자「완전 초보입니다. 어떤 X가 가장 시작하기 쉬운가요?」

잡음 하한 - 이것이 없으면 이 글은 존재하지 않습니다

어시스턴트는 결정론적이지 않습니다. 같은 질문을 다시 해도 같은 목록이 나오지 않습니다. 스스로 얼마나 어긋나는지 모른 채 두 표현을 비교하면, 우연을 결과라 부르며 공개하는 셈입니다.

그래서 기준 질문을 조합마다 세 번 실행해 「같은 질문, 두 답변」 쌍을 46개 만들었습니다. 그 평균 겹침 - 77 % - 이 하한입니다. 의도 간의 모든 차이는 이것에 비추어 읽고, 절대값으로는 결코 읽지 않습니다.

결과

기준 질문과 추천 목록의 겹침. Perplexity와 Gemini, 영어·프랑스어, 2026-08-26.
던진 질문겹침잡음과의 차이
같은 질문을 다시(하한)77 %-
가성비가 가장 좋은 것53 %24포인트 아래
초보입니다40 %37포인트 아래
10명 규모 회사입니다31 %46포인트 아래

두 엔진이 각각 따로 같은 방향으로 움직였습니다 - 그래서 공개할 수 있습니다. Perplexity는 하한 84 %에서 「작은 회사」 질문에 39 %로, Gemini는 68 %에서 23 %로 내려갔습니다. 값은 다르지만 방향과 크기는 다르지 않습니다.

이것을 구체적으로 만드는 사례

호텔 예약에서 어시스턴트는 매우 잘 재현합니다 - 같은 질문 두 번 실행에 86 % 겹침. 거기에 「10명 규모 회사를 운영합니다」를 더하면 겹침은 0 %로 떨어집니다. 30도 15도 아닌 영. 공통되는 기업이 하나도 없습니다.

이름을 보면 이유를 알 수 있습니다. 기준 질문은 누구나 아는 일반 소비자용 플랫폼을 돌려줍니다. 「10명 규모 회사」 질문은 TravelPerk, Engine, Booking.com for Business - 출장 분야 사업자를 떠오르게 하고, 이들은 첫 목록에 없었습니다. 순위가 움직인 것이 아니라, 다른 시장이 답한 것입니다.

질문에 따라 바뀌는 것은 당신의 순위가 아닙니다. 후보 명단 자체입니다.

다른 분야에서도 같은 양상입니다. 영어 웹 호스팅에서는 NamecheapWix가 「작은 회사」, 「가격」, 「초보자」 질문에만 나타납니다. 프랑스어 CRM에서는 HubSpot이 기준 목록에 없다가, 「작은 회사」나 「이제 시작합니다」를 덧붙이는 순간 등장합니다.

경쟁 가설을 검증하고 기각했습니다

이렇게 선명한 결과에는 진지한 반론이 따르기 마련이라, 우리 자신에게 그것을 제기했습니다. 우리 이름 추출기는 조언의 조각(「연동을 확인하세요」, 「최소 예산」)을 통과시킵니다. 그리고 가격에 관한 질문은 초보자 질문과 다른 조언 어휘를 만들어냅니다. 이 잡음만으로 차이가 만들어졌을 수 있었습니다.

그래서 거친 것부터 가장 엄격한 것까지 네 단계의 정제로 계산을 다시 했습니다 - 여러 답변에 되풀이해 등장하는 이름만 남기는 방식입니다. 진짜 기업명은 되풀이되고, 조언 표현은 일회성이기 때문입니다. 잡음 하한은 예상대로 62 %에서 79 %로 올라갑니다. 그러나 차이는 네 경우 모두 29~36포인트로 유지됩니다. 반론은 성립하지 않습니다. 우리는 가장 보기 좋은 계산이 아니라 가장 엄격한 계산을 공개합니다.

무엇을 할 것인가

자기 카테고리가 아니라 고객의 질문을 적으십시오.

「최고의 청구서 소프트웨어」는 기자의 질문입니다. 당신의 구매자는 「비영리단체용으로」, 「경리 없이」, 「해외 청구용으로」라고 말합니다. 측정해야 할 것은 그 문장입니다.

한 표현에서의 좋은 성적은 옮겨가지 않습니다.

46포인트 차이란, 일반적인 질문에서 추천받는 것이 당신의 실제 세그먼트 질문에 대해 거의 아무것도 예측하지 못한다는 뜻입니다.

구매 맥락은 위험이자 지렛대입니다.

일반 목록에 없더라도 당신의 세그먼트에 고유한 질문이 있다면, 존재해야 할 곳은 바로 거기이며 - 그곳은 경쟁이 훨씬 덜합니다.

당신의 페이지가 「누구를 위한 것인지」 말하게 하십시오.

「10명 규모 회사」 답변에 이름을 넣는 출처는 그 사례를 명시적으로 다루는 페이지입니다. 누구를 향한 것인지 말하지 않는 페이지는 특정 프로필에 대해 선택될 수 없습니다.

한계

측정에서 뺀 분야 하나: 러닝화.

이 분야의 답변은 번호가 붙은 모델명(「Ghost 16」, 「Clifton 9」)을 인용하는데, 우리 추출기가 그것을 버립니다. 그래서 분야 전체가 어디서나 0 %로 나왔습니다 - 우리 필터의 부산물이지 결과가 아닙니다. 그것을 공개했다면 정직하지 못한 일이었을 것입니다.

2개 언어, 2개 엔진.

영어와 프랑스어, Perplexity와 Gemini. API로 호출하는 ChatGPT는 제외했습니다 - 전혀 검색하지 않는다는 것을 측정했으므로 의도가 같은 역할을 하지 않습니다.

단 하루.

이 측정에는 날짜가 있고 어시스턴트는 변합니다. 바로 그래서 모든 숫자에 잡음 하한을 붙입니다.

우리 추출기는 여전히 불완전합니다.

정제 후에도 일부 표현(「기술 지원」, 「프랑스 중소기업」)이 집합에 남아 있습니다. 수정이 진행 중입니다. 정제 과정을 숨긴 숫자는 숫자가 아니므로 여기서 밝힙니다.

우리는 누구에게도 ChatGPT 답변에서의 자리를 약속하지 않습니다 - 정직하게 그렇게 할 수 있는 곳은 없습니다. 측정할 수 있는 것은 언어별로, 엔진별로, 그리고 이제는 던져진 질문별로 당신이 어디에 있는지입니다.

자주 묻는 질문

질문하는 방식에 따라 AI가 추천하는 기업이 달라지나요?
네, 크게 달라집니다. 2026년 8월 26일 120회 측정에서, 똑같은 질문을 다시 하면 목록의 겹침은 77 %였습니다. 「최고의 X는」 대신 「10명 회사에는 어느 것」이라고 물으면 이 겹침은 31 %로 떨어집니다. 잡음 하한보다 46포인트 아래입니다.
「최고의 X」에서 좋은 결과가 나오면 작은 기업에도 추천되나요?
아닙니다. 그것이 이 측정의 핵심 교훈입니다. 46포인트 차이가 있는 이상, 일반적인 질문에서 언급되는 것은 특정 세그먼트의 질문에 대해 거의 아무것도 예측하지 못합니다. 호텔 예약에서는 두 표현 사이의 겹침이 0 %까지 떨어졌습니다 - 공통 기업이 하나도 없었습니다.
잡음 하한이란 무엇이고, 왜 공개하나요?
어시스턴트는 결정론적이지 않아 같은 질문을 두 번 해도 같은 목록이 나오지 않습니다. 잡음 하한은 동일한 질문에 대한 두 답변 사이에서 측정한 겹침이며, 여기서는 46개 쌍에 대해 77 %였습니다. 이것이 없으면 두 표현 사이의 차이가 진짜 효과인지 그날의 우연인지 구분할 수 없습니다.
AI 가시성을 위해 어떤 질문을 측정해야 하나요?
고객이 실제로 하는 질문을, 그 맥락과 함께 측정해야 합니다 - 회사 규모, 예산, 숙련도. 일반적인 카테고리 질문(「최고의 X 소프트웨어」)은 수요의 일부만 덮으며, 우리 측정에 따르면 나머지를 잘 예측하지 못합니다.
이 결과가 측정의 부산물이 아님을 어떻게 확인했나요?
우리 자신에게 가장 진지한 반론을 검증했습니다. 우리 추출기는 조언의 조각을 통과시키고, 그 어휘는 의도에 따라 달라집니다. 네 단계의 정제로 계산을 다시 했더니 하한은 62 %에서 79 %로 올랐지만, 표현 간 차이는 네 경우 모두 29~36포인트로 유지되었습니다.