이름에 대문자가 없을 때 - 우리 도구는 일본과 한국에서 아무것도 보지 못했습니다
2026년 8월 17일 여섯 시장에서 측정. 일본어와 한국어에서는 언급된 이름의 100%가 현지 문자로 쓰여 있습니다. 그런데 우리 추출기는 라틴 대문자를 요구하고 있었습니다.
어제부터 이 제품은 일본어, 한국어, 중국어, 아랍어, 스페인어로 질문을 던지기 시작했습니다. 오늘 아침 그 시장들을 처음으로 측정했습니다. 측정이 가장 먼저 찾아낸 경쟁자는 우리 자신의 도구였습니다.
절차는 이 연재의 것입니다. 여섯 시장(리옹, 멕시코시티, 도쿄, 서울, 싱가포르, 두바이), 시장마다 두 업종 - 차이가 '그 업종이 특별해서'로 설명되지 않도록 - , 어시스턴트 셋, 그리고 각 질문을 두 번씩. 8월 15일 글이 의무로 만든 잡음 대조군입니다. 답변 일흔두 개.
우리 자신에 대해 알아낸 것
답변을 읽기도 전에, 이름 추출이 일본어·한국어·중국어·아랍어에서 0을 냈습니다. 이름이 한눈에 보이는 예시에 대해서 말입니다. 원인은 우리 분석기의 한 줄에 담깁니다. 업체 이름으로 남으려면 그 문자열이 대문자를 포함해야 했습니다.
그것은 라틴 문자의 규칙입니다. 이 네 문자 체계에는 대소 구분이 아예 없습니다. 일본어에도 한국어에도 중국어에도 아랍어에도 대문자란 것이 존재하지 않습니다. 그러니 이 문자로 쓰인 업체 이름은 조건을 만족할 방법이 없었고, 전부 조용히 버려졌습니다.
일본어 진단은 이름에 라틴 대문자가 들어간 경쟁사만 보고 있었습니다.
그날 아침에 바로 고쳤습니다. 대소 구분이 없는 문자 체계의 한 글자가 대문자 노릇을 하게 했고, 히브리 문자와 타이 문자도 미리 포함했으며, 라틴 규칙은 건드리지 않았습니다. 수정을 고정하는 시험은 거꾸로 확인했습니다 - 옛 규칙을 되돌리면 네 개의 시험이 떨어집니다. 문자 체계마다 하나씩입니다.
이것이 코드만의 이야기가 아닌 이유
분석기를 고친 뒤 '제일 좋은 빵집' 질문에 대해 시장별·엔진별로 나온 결과입니다. 언급된 이름 가운데 현지 문자로 쓰인 것의 비율입니다.
도쿄: 15/15, 16/16, 14/14.
세 어시스턴트가 대는 것은 전부 일본어로 쓰여 있습니다.
서울: 11/11, 13/13, 10/10.
마찬가지로, 예외가 하나도 없습니다.
싱가포르: 3/10, 8/16, 13/15.
도시와 마찬가지로 섞인 시장입니다.
두바이: 0/10, 12/16, 9/16.
그리고 이 첫 숫자가 이날 가장 많은 것을 말합니다.
도쿄와 서울에서는, 오늘 우리 추출기가 붙잡는 것이 어제는 전부 보이지 않았습니다. '적게 세어진' 것이 아니라 보이지 않았던 것입니다. 보고서는 멀쩡하게 표시되었을 것입니다 - 경쟁사 표가 빈 채로, 그 위에 점수를 얹고서.
두바이 - 같은 도시 안의 두 시장
두바이에서 제일 좋은 빵집을 아랍어로 물으면 ChatGPT는 열 곳을 댑니다. 그 열 곳 중 아랍어 이름을 가진 곳은 하나도 없습니다 - Ladurée, Paul, Baker & Spice, Le Pain Quotidien, Magnolia Bakery. 같은 질문에 Gemini는 열여섯 중 열둘을 아랍 문자 이름으로, Perplexity는 열여섯 중 아홉을 대며 그중에는 مخبز حبيب 과 مخبز الريف اللبناني 가 있습니다.
라틴 문자만 읽는 도구라면 ChatGPT의 목록을 통째로, Gemini의 목록은 일부만 보고서 두바이의 빵집이란 Ladurée를 뜻한다고 결론지었을 것입니다. 읽기의 결함과 시장의 사실은 정확히 같은 모양입니다 - 당신의 문자로 쓰이지 않은 것은 세어지지 않습니다.
나머지 측정은 이 연재가 열흘째 보여 온 것을 뒷받침합니다. ChatGPT는 한국어에서도 프랑스어에서도 빵집을 한 곳도 대지 않았습니다. 되물음으로 답했지요 - '어떤 종류의 빵을 좋아하시나요', '어느 지역을 원하시나요'. 같은 질문에 Gemini는 리옹에서 열한 곳, 서울에서 열한 곳을 댑니다.
이것을 어떻게 쓸까
AI 가시성 도구에 당신의 문자를 읽을 수 있는지 물어보십시오.
그날이 오기 전까지는 우스운 질문처럼 들립니다. 우리 도구는 라틴 문자로 쓰는 사람들이 만들었고, 그것이 코드에 드러났습니다.
라틴 문자가 아닌 언어에서 나온 0점은 손으로 확인할 가치가 있습니다.
일본어든 한국어든 아랍어든, 앱에 직접 물어보고 도구가 보여 주는 것과 견주어 보십시오.
섞인 시장에서는 두 문자 체계로 재십시오.
두바이에서는 아랍어 목록과 라틴 문자 목록이 거의 겹치지 않습니다. 판은 하나가 아니라 둘입니다.
ChatGPT 하나를 잣대로 삼지 마십시오
- 우리 여섯 시장에서 업체 이름을 가장 적게 대는 엔진이고, 때로는 하나도 대지 않습니다.
한계, 그리고 열린 채로 남는 하나
여섯 시장, 두 업종, 하루 아침, 엔진마다 모델 하나. 표본 조사이지 전수 조사가 아닙니다. 언급된 가게가 실재하는지는 확인하지 않았습니다 - 언급된 것을 분류했을 뿐, 가게를 감사하지 않았습니다.
그리고 구멍 하나가 열린 채로 남아 있으니 여기 적어 둡니다. 조언을 업체로 착각하지 않도록 걸러 내는 목록 - '서면 견적을 요구하라', '면허를 확인하라' - 은 프랑스어와 영어 문구의 목록입니다. 새로 들어온 네 문자 체계를 덮지 못합니다. 따라서 위의 셈은 실재하는 가게와 조언의 조각을 섞고 있습니다. 문자 체계 측정 자체는 달라지지 않지만(일본어로 된 조언도 일본어로 쓰이니까요) 이것을 업체의 수로 읽는 것은 금지됩니다. 다음 일감이 그것이고, 감추는 대신 이름을 붙여 둡니다.