본문으로 건너뛰기
Waseit
← 모든 글
AEOGEO

llms.txt로 간 1,227건의 요청, AI 크롤러는 0건: 놓을 파일 같은 것은 없다

AI 크롤러는 돌려보내는 방문자 한 명당 수천 개의 페이지를 가져가고, 그들에게 말을 걸어야 할 파일은 그 누구도 읽지 않는다. 공개된 측정이 보여주는 것.

1,227건 중 0건

서버 로그 연구에서, 주요 연구소 크롤러로부터 온 llms.txt 요청

2026년 9월 3일9 분 소요
이 글의 목차
  1. 교환은 기울어져 있고, 셀 수 있다
  2. 아무도 읽지 않는 파일
  3. 구글이 공식적으로 말하는 것
  4. 왜 놓을 파일이 없는가
  5. 이것이 바꾸는 것

짧은 답: AI 답변에서의 가시성은 설정으로 얻어지지 않는다. 두 측정이 함께 그렇게 말한다. 한편으로 대형 모델의 크롤러는 돌려보내는 방문자 한 명당 수백에서 수천 개의 페이지를 가져간다. 다른 한편으로 업계가 사이트 최상위에 놓기 시작한 llms.txt 파일은 주요 연구소의 검증된 크롤러 그 어느 것도 요청하지 않으며, 구글은 그것을 무시한다고 밝혔다. 뒷문은 없다. 판가름은 말뭉치 안에서 난다.

3,389 : 1

돌려보내는 방문자 한 명당 Mistral 크롤러가 가져가는 페이지 수 (Cloudflare Radar, 2026년 7월)

없음

약 30만 개 도메인에서 측정한, llms.txt 게시와 인용 사이의 상관

AI 답변 안에 존재하기 위해 최상위에 놓을 파일 같은 것은 없다. 가시성은 말뭉치 안에서 얻는 것이지 선언하는 것이 아니다.

교환은 기울어져 있고, 셀 수 있다

Cloudflare는 단순하고 가혹한 지표를 공개한다. 어떤 AI 플랫폼이 사이트에 읽으러 오는 페이지 수와, 그 사이트로 돌려보내는 방문자 수의 비율이다. 정의는 기계적이다. 한 플랫폼의 에이전트에서 온 HTML 요청을 세고, 참조 헤더에 그 플랫폼 이름이 담긴 HTML 요청으로 나눈다.

돌려보낸 방문자 한 명당 읽힌 페이지 수, Cloudflare Radar 기록, 2026년 7월 21일에 닫힌 28일 창. 비율은 스냅숏으로 읽을 것: 빠르게 움직인다.
플랫폼돌려보낸 방문자당 가져간 페이지
Mistral3,389 : 1
Anthropic2,237 : 1
OpenAI (GPTBot)217 : 1
DuckDuckGo2.5 : 1

소수점보다 자릿수가 중요하며, 그 자릿수는 2026년에 크게 움직였다. Anthropic의 비율은 1분기에 수만 단위로 세어졌다가 여름에는 수천 단위로 떨어졌다. 방향은 옳고, 불균형은 그대로 남아 있다. 사이트로서는 기계의 읽기가 이미 표준이 되었고, 그것을 지탱하던 사람의 방문이 예외가 되어간다는 뜻이다.

Cloudflare가 스스로 덧붙였고 인용에서는 흔히 빠지는 단서가 있다. Claude의 네이티브 앱에서 오는 유입은 참조 헤더를 싣지 않는다. 그 유입은 분모에서 보이지 않으며, Cloudflare는 자사의 비율이 불균형을 과장할 수 있다고 쓰면서 그 정도는 알 수 없다고 밝힌다. 결론의 방향은 유지되지만 정밀도는 유지되지 않는다.

아무도 읽지 않는 파일

이 불균형 앞에서 업계는 단순한 답을 내놓았다. llms.txt, 사이트 최상위에 놓아 무엇을 어떻게 읽을지 모델에게 알려주는 파일이다. 착상은 매력적이다. 결함이 하나 있다. 크롤러가 그것을 요청하지 않는다.

2025년 9월부터 2026년 4월까지 약 900개 도메인에서 진행된 서버 로그 연구는 이 파일들에 대한 요청 1,227건을 기록했고, 그중 주요 연구소의 검증된 크롤러에서 온 것은 단 하나도 없었다 - GPTBot도, ClaudeBot도, PerplexityBot도, Google-Extended도 없었다. 요청한 쪽은 상업용 데이터 수집업체가 794건으로 64.7%, 사람의 브라우저가 392건으로 31.9%였다. 달리 말하면, 이 파일을 읽는 이들은 그 주변에서 도구를 파는 이들과 호기심 많은 이들이다.

채택률은 누구를 보느냐에 따라 완전히 달라진다. 그래서 정반대되는 이야기가 함께 읽힌다.

표본에 따른 llms.txt 채택률. 같은 대상을 네 모집단에서 재면 네 개의 답이 나온다. 이 중 하나만 인용하면 오도한다.
측정한 표본채택률
개발자 성향 218개 호스트 패널 (2026년 8월)51.8%
Tranco 상위 1,000, 도달 가능한 루트 (2026년 6월)15.8%
약 30만 개 도메인 (2025년 11월)10.13%
Tranco 상위 1,000, 전체 (2026년 6월)8.7%

그리고 모든 것을 가르는 물음에 대해, 약 30만 개 도메인에서 수행된 상관 연구는 이 파일을 게시하는 것과 모델에 인용되는 것 사이에 측정 가능한 연관을 전혀 찾지 못했다. 그 변수를 빼자 통계 모형의 정확도가 오히려 좋아졌는데, 이는 그 변수가 잡음을 보태고 있었다는 말의 정중한 표현이다.

구글이 공식적으로 말하는 것

입장은 모호하지 않다. 2026년 6월에 갱신된 구글 문서는 이 파일이 검색 순위에도 AI Overviews에도 긍정이든 부정이든 아무 영향이 없으며, 검색은 그저 무시한다고 적고 있다. Chrome 팀은 2026년 5월 Lighthouse에 llms.txt 점검을 추가했지만 SEO 감사가 아니라 에이전트 브라우징 감사로 분류했고, 알리는 것은 서버 오류뿐이며 파일 부재는 결코 알리지 않는다.

이 분류가 많은 것을 말해준다. 이 파일은 사용자를 대신해 웹을 도는 에이전트를 위한 대상으로 취급되지, 순위 신호로 취급되지 않는다. 놓는 데 드는 비용은 거의 없고 해도 없다. 다만 거기서 가시성을 기대해서는 안 된다.

왜 놓을 파일이 없는가

두 측정은 서로에게 답한다. 모델들은 열린 웹을 대량으로 읽으며 당신의 페이지도 거기 포함된다. 그리고 그것은 당신이 열어둔 문을 통해서가 아니다. 따라서 그들이 당신에 대해 간직하는 것은 당신 도메인 최상위에서 한 선언에서 오지 않고, 당신이 통제하지 못하는 말뭉치 안에서 당신에 대해 말해지는 것에서 온다.

이는 엔진 간 비교가 보여주는 것의 정확한 연장이다. 그들은 같은 출처를 읽지 않으면서도 추천하는 이름에서는 훨씬 더 일치한다. 설정 파일은 그에 대해 아무것도 할 수 없다. 어느 방향으로도 그렇다. 무게가 실리는 것은 당신에 대해 쓰인 것의 일관성이며, 기계가 그것을 귀속시킬 수 있는지 여부다.

  • 수집 비율은 스냅숏이지 상수가 아니다.

    Cloudflare의 수치는 달마다 움직이며 2026년 동안 한 자릿수만큼 떨어졌다. 7월 기록과 3월 기록을 비교하는 것은 의미가 없고, 우리가 직접 잰 것도 아니다.

  • Cloudflare는 자사의 비율이 불균형을 과장할 수 있다고 경고한다.

    Claude 네이티브 앱의 유입은 참조 헤더를 보내지 않아 분모에서 빠진다. 회사가 그렇게 말하고 편향의 크기는 모른다고 밝힌다. 우리는 수치와 함께 그 경고도 전한다.

  • 서버 로그 연구는 작다.

    약 900개 도메인에서 1,227건의 요청. 주요 연구소 크롤러가 그곳에 나타나지 않는다고 확인하기에는 충분하지만, 앞으로도 결코 나타나지 않으리라 단언하기에는 부족하고, 웹 전체를 대변하기에도 부족하다.

  • 채택률은 서로 비교할 수 없다.

    같은 대상에 대해 표본에 따라 8.7%에서 51.8%까지 벌어진다. 차이는 관찰된 모집단에 있지 시간에 따른 변화가 아니다. 그중 하나만, 어느 것인지 밝히지도 않고 인용하는 글은 아무것도 알려주지 않는다.

이것이 바꾸는 것

파일에 기대지 마라.

llms.txt를 놓는 일은 저렴하고 무해하지만, 공개된 어떤 측정도 그것을 인용과 연결하지 않는다. 가시성의 지렛대가 아니라, 아직 존재하지 않는 에이전트를 향한 예의에 가깝다.

당신의 로그를 읽어라.

질의 하나면 어떤 크롤러가 얼마나 자주 무엇을 요청하며 오는지 알 수 있다. 이 사안에서 당신이 스스로 만들 수 있는 유일한 자료이며, 세계 평균보다 낫다.

무엇을 가져가게 할지 결정하라.

읽힌 페이지와 돌려받은 방문자의 비율은 협상이지 운명이 아니다. 어떤 에이전트를 허용할지, 늦출지, 막을지는 당신에게 속한 상업적 결정이며 크롤러별로 내리는 것이다.

준수가 아니라 인용을 측정하라.

기술 항목에 표시했다는 사실은 답변 속 당신의 존재에 대해 아무것도 말해주지 않는다. 쓸모 있는 물음은 그대로다. 당신의 이름이 나오는가, 어느 엔진에서, 누구 옆에.

자주 묻는 질문

그래도 llms.txt 파일을 게시해야 하나
해도 된다. 해롭지 않고 비용도 거의 없다. 다만 인용에 대한 효과를 보여주는 공개 측정은 없다. 약 30만 개 도메인을 다룬 연구는 연관을 찾지 못했고, 구글은 2026년 6월부터 이 파일이 순위에도 AI Overviews에도 영향이 없다고 밝히고 있다. 미래의 에이전트를 위해 사이트를 기술해 두고 싶다면 게시하라. 가시성을 얻기 위해서가 아니다.
AI 크롤러를 차단해야 하나
그것은 기술이 아니라 상업적 결정이며, 크롤러별로 내린다. 공개된 비율은 플랫폼 사이에 상당한 격차를 보여준다. 돌려보낸 방문자당 수천 페이지를 가져가는 쪽부터 거의 균형에 가까운 쪽까지 있다. 차단은 당신의 페이지를 지키지만, 경쟁자는 남아 있을 답변에서 당신을 빼기도 한다. 먼저 로그를 보고, 그다음 출처별로 판단하라.
파일이 소용없다면 무엇이 통하나
측정이 가리키는 것은 엔진이 실제로 읽는 곳에서 당신에 대해 말해지는 내용의 일관성이며, 어떤 주장을 기계가 출처에 귀속시킬 수 있는지다. 생성 엔진 최적화 연구에서 검증된 지렛대는 편집에 속한다. 출처를 인용하고, 발언을 옮기고, 수치를 제시하고, 명료하게 쓰는 것이다. 도메인 최상위에 놓는 종류의 것은 없다.