본문으로 건너뛰기
Waseit
← 모든 글
AEO측정

AI 추천은 하루 만에 바뀔까요?

오늘 아침 다시 측정했습니다. 8월 6일에 AI가 언급한 이름 81개 중 8일에 다시 나온 것은 15개뿐. 48시간을 버티는 것과 흔들리는 것, 그리고 그 이유.

2026년 8월 8일6 분 소요
이 글의 목차
  1. 오늘 아침 정확히 무엇을 측정했나
  2. 왜 이렇게 적은 이름만 남을까
  3. 내일 아침 무엇을 할까

꼭 일 년 남짓 전인 2025년 8월 7일, OpenAI는 하룻밤 사이에 ChatGPT의 기본 모델을 GPT-5로 갈아 끼웠습니다. 수백만 명이 답변의 어조와 내용이 한꺼번에 달라지는 것을 봤고, 반발이 워낙 커서 8월 12일에는 유료 구독자에게 이전 모델이 되돌아왔습니다. 그리고 또 한 번 - 2026년 5월 5일, GPT-5.5 Instant가 새 기본값이 되었습니다. 일 년에 두 번, 어시스턴트 밑에 있는 엔진이 바뀐 것입니다. 이름이 불리거나 더는 불리지 않게 되는 기업들에게는 아무 예고 없이.

걱정할 일이었을까요. 우리는 재보기로 했습니다. 오늘 아침 2026년 8월 8일, 8월 6일에 던졌던 네 개의 질문을 한 글자도 바꾸지 않고 다시 던졌습니다. 보르도와 릴에서 제일 좋은 배관공은 누구냐는, 손님이 실제로 치는 말투 그대로, 같은 어시스턴트 셋 - ChatGPT, Gemini, Perplexity - 에게. 답변 열두 개를 다시 모아 목요일의 열두 개와 맞춰 봤습니다. 제목의 질문에 대한 답은 '그렇다', 그것도 크게. 목요일에 나온 서로 다른 이름 81개 중 토요일에 다시 나타난 것은 15개뿐이고, 그 열다섯 중 둘은 집계가 잡아낸 소제목이지 기업이 아닙니다. 언급된 이름 여섯 개 중 하나꼴로 48시간을 버틴 셈입니다. AEO(Answer Engine Optimization, 어시스턴트의 답변 안에 존재하기)가 가장 먼저 똑바로 봐야 할 것이 이 불안정성입니다.

오늘 아침 정확히 무엇을 측정했나

방법은 한 문장이면 됩니다. 같은 질문, 같은 엔진 셋, 같은 모델, 48시간 간격, 양쪽에서 각각 열두 개의 답변, 이름은 우리 보고서와 같은 파서로 집계 - 그러니 차이는 전부 답변이 움직인 것이지 방법이 흔들린 것이 아닙니다. 진짜 결과는 엔진별 내역에 있습니다. ChatGPT, 웹 검색 없이 API로 물었을 때: 26개 중 남은 이름 0개. Gemini: 29개 중 1개 - 전국 규모의 욕실 전문 매장 Espace Aubade. Perplexity, 셋 중 유일하게 답하는 순간 웹을 읽는 엔진: 28개 중 12개가 남았습니다.

목요일에 자신 있게 불린 이름이 토요일에는 다시 불리지 않습니다 - 그 이름을 내놓은 엔진에서조차.

가장 말해 주는 사례. 목요일에 ChatGPT는 'Plomberie Lille Services'를 그럴듯한 근거까지 붙여 추천했습니다. 우리가 실재하는 어떤 기업과도 연결하지 못해 미확인으로 표시해 둔 이름입니다. 토요일에는 아예 꺼내지 않습니다. 쓴 당사자조차 반복하지 않는 것입니다. 거절도 일정하지 않습니다 - 목요일에는 네 질문 중 셋을, 토요일에는 넷 중 둘을 거절했습니다.

왜 이렇게 적은 이름만 남을까

안정성은 'AI'의 성질이 아니라 그 출처의 성질이기 때문입니다. ChatGPT는 기억으로 답합니다 - 토요일 답변에서 스스로 이렇게 씁니다. '2023년까지 확보된 평가와 추천을 바탕으로'(번역은 우리). 생성할 때마다 표본을 새로 뽑는 기억은 뽑을 때마다 다른 목록을 냅니다. 반면 Perplexity는 질문받은 시점에 디렉터리를 다시 읽습니다. Bilik이나 ThreeBestRated, Travaux.com이 48시간 사이에 바뀌지 않았으니 그 이름들이 남는 것입니다. 남은 것의 순서도 보십시오 - 먼저 디렉터리와 플랫폼 자신, 그다음에 그들이 순위를 매긴 기술자들. AI 가시성에서 안정적인 층은 글로 쓰인 출처입니다. 한 번의 생성이라는 제비뽑기가 아니라.

여기에 문제의 규모를 더해 보십시오. 기본 모델이 바뀌는 날 - 2025년 8월 7일, 2026년 5월 5일 - 에는 수천만 명분의 답변이 같은 날 다시 나뉩니다. 당신도, 경쟁사도, 고객도 아무것도 하지 않았는데 점수가 움직일 수 있다는 뜻입니다. 그러니 한 장짜리 스냅숏은 좋든 나쁘든 거의 아무것도 말해 주지 않습니다. 말하는 것은 계열입니다 - 측정을 거듭할 때마다 당신의 이름이 얼마나 자주 돌아오는지, 그리고 그것을 실어 나르는 출처가 무엇인지.

내일 아침 무엇을 할까

  • 한 번의 측정으로 결론 내리지 마십시오 - 0점에 당황하지도, 좋은 점수에 자축하지도 마십시오. 일정한 간격으로 다시 재십시오. 의미가 있는 것은 추세이지 한 점이 아닙니다.
  • 버틴 층에 투자하십시오. 웹을 읽는 엔진이 참조하는 디렉터리와 플랫폼입니다. 우리 측정에서 48시간 뒤에도 여전히 불린 기술자는 전부 거기서 왔습니다.
  • 기본 모델이 바뀐 날짜를 적어 두십시오(공개되어 있습니다). 교체된 날에 가시성이 움직였다면 원인은 아마 당신보다 위에 있습니다 - 당신 회사 안이 아니라.
  • 세 엔진을 따로, 무료로, 60초 만에 재십시오. 그리고 다음 달에 다시 재십시오. 상품은 비교이지 사진이 아닙니다.

마무리로 늘 하는 정직한 말. 네 개의 질문, 열두 개의 답변, 두 도시, 한 직종 - 이것은 표본 조사이지 전수 조사가 아닙니다. 그래도 자릿수는 우리 세 개의 전국 조사가 이미 보여 준 것(세 엔진이 서로 일치하는 이름은 2~3%에 지나지 않는다)과 맞물리고, 날짜가 있고, 공개되어 있으며, 다시 검증할 수 있습니다. AI의 추천은 상태가 아니라 사건입니다. 사건은 관리할 수 없습니다 - 관리할 수 있는 것은 그 빈도입니다.