본문으로 건너뛰기
Waseit
← 모든 글
AEOGEO

200건 중 134건이 오답, 표명된 의심은 15번: 인용되는 것은 올바르게 인용되는 것이 아니다

두 건의 대규모 연구가 AI 엔진의 인용을 측정했다. 60% 넘게 틀렸고, 31%는 출처에 문제가 있으며, 말투의 확신은 결코 낮아지지 않는다. 그것이 브랜드에 무엇을 바꾸는가.

60% 이상

1,600건 질의에서 틀린 인용의 비율, 여덟 개 엔진 검증 (Tow Center, 2025년 3월)

2026년 9월 5일9 분 소요
이 글의 목차
  1. 두 건의 대규모 연구가 측정한 것
  2. 최악은 오류가 아니라 그 확신이다
  3. 아무 데도 이어지지 않는 링크
  4. 브랜드에 무엇이 바뀌는가
  5. 이것이 바꾸는 것

짧은 답: AI의 인용은 당신의 이름을 부르면서 당신에 대해 틀릴 수 있다. 공개된 측정이 다루는 것은 등장 여부가 아니라 귀속된 내용의 정확성이다. 1,600건의 질의를 다룬 연구에서 60%가 넘는 인용이 틀렸고, 3,000건이 넘는 답변을 다룬 다른 연구에서는 31%에 출처 문제가 있었다. 따라서 쓸모 있는 물음은 「인용되었는가」만이 아니다. 「내가 말했다고 된 것이 사실인가, 그리고 그 링크는 어딘가로 이어지는가」이다.

31%

출처에 문제가 있던 답변의 비율: 귀속 누락, 오해를 부르는 귀속, 잘못된 귀속 (EBU와 BBC, 2025년 10월)

134 대 15

ChatGPT가 잘못 식별한 기사 수와, 의심을 표시한 횟수, 200건의 답변 기준

틀리면서 그렇다고 말하는 엔진은 기회를 남긴다. 확신에 차서 틀리는 엔진은 남기지 않는다. 읽는 사람에게 확인할 이유가 없기 때문이다.

두 건의 대규모 연구가 측정한 것

첫 번째는 컬럼비아의 Tow Center for Digital Journalism이 2025년 3월 6일에 발표한 것이다. 절차는 단순하고 재현 가능하다. 스무 곳의 발행사에서 각각 열 편의 기사를 무작위로 뽑고, 발췌문을 그대로 복사한 뒤, 여덟 개의 응답 엔진에 제목, 원 발행사, 날짜, URL을 식별하게 한다. 모두 1,600건의 질의다. 전체적으로 엔진들은 그중 60%가 넘는 질의에 틀린 답을 내놓았다.

잘못된 인용, 여덟 개 응답 엔진, 1,600건 질의 (Tow Center, 2025년 3월 6일). 여기 적은 엔진별 수치는 연구가 명시한 값이다.
측정결과
여덟 개 엔진 전체60% 이상 틀린 답변
Perplexity, 이 중 최고37% 오답
Grok-3, 이 중 최악94% 오답
Grok-3, 오류 페이지로 이어진 인용200건 중 154건

두 번째는 더 넓고 공영방송에서 나왔다. 2025년 10월 22일 유럽방송연맹이 BBC와 함께 발표했으며, 직업 기자들이 ChatGPT, Copilot, Gemini, Perplexity의 답변 3,000건 이상을 22개 조직, 18개국, 14개 언어에 걸쳐 평가했다. 핵심 결론은 이 결함이 구조적이라는 것이다. 언어에도, 시장에도, 특정 어시스턴트에도 매이지 않는다.

기자들이 3,000건 이상의 답변에서 확인한 결함, 22개 공영 언론, 18개국, 14개 언어 (EBU와 BBC, 2025년 10월 22일).
결함의 종류답변에서 차지하는 비율
적어도 하나의 중대한 문제45%
출처 문제: 귀속 누락, 오해를 부르는 귀속, 잘못된 귀속31%
중대한 정확성 문제: 지어낸 세부, 낡은 정보20%
Gemini, 중대한 문제가 있는 답변76%

최악은 오류가 아니라 그 확신이다

Tow Center의 수치 하나는 따로 떼어낼 만하다. 나머지 전부를 좌우하기 때문이다. ChatGPT는 200건 중 134건의 기사를 잘못 식별했고, 확신이 부족하다고 알린 것은 열다섯 번뿐이었다. 오류와 의심은 연동되지 않는다. 세 번 중 두 번 틀리면서, 열세 번에 한 번 그것을 말한다.

이것이 오류를 범할 수 있는 출처와, 오도하는 출처의 차이다. 망설이는 엔진은 읽는 사람에게 신호를, 따라서 확인할 기회를 남긴다. 단언하는 엔진은 아무것도 남기지 않는다. 기업에게 이는 잘못된 인용이 저절로 고쳐지지 않는다는 뜻이다. 답변 안 어디에도 그것을 의심하게 만드는 것이 없기 때문이다.

아무 데도 이어지지 않는 링크

다른 발견은 한층 더 구체적이다. Gemini와 Grok-3 답변의 절반 이상이 지어냈거나 죽은 URL을 가리켰다. Grok-3에서는 200건의 인용 중 154건이 오류 페이지에 도달했다. 이 엔진은 귀속을 잘못하는 데 그치지 않는다. 증거처럼 보이는 주소를 만들어낸다.

EBU 연구는 출처 쪽에서 같은 구조를 서술한다. 한 적 없는 주장을 언론사에 귀속시키고, 다른 주제의 기사나 사라진 페이지로 이어지는 링크를 제시하며, 때로는 매체명과 제목과 날짜까지 갖춘 완전한 인용을 한 번도 나온 적 없는 기사에 붙인다. 형식이 갖춰진 출처 표시가 참된 출처 표시는 아니다.

브랜드에 무엇이 바뀌는가

논리는 그대로 옮겨진다. 어떤 문장을 쓰지 않은 언론사에 귀속시킬 수 있는 엔진이라면, 당신의 논거나 가격이나 전문 분야를 경쟁사에 귀속시킬 수도 있다. 반대로 당신이 한 적 없는 약속을 당신에게 지울 수도 있다. 두 경우 모두 당신은 「인용」되어 있고, 두 경우 모두 인용 수만 세는 계기판은 좋은 소식을 표시한다.

이것이 가시성 점수를 단독으로 볼 때의 한계이며, 우리 것도 예외가 아니다. 등장하는 것은 필요조건이지 결과의 척도가 아니다. 인용은 세 가지 물음으로 읽는다. 우리가 지명되었는가, 우리에게 귀속된 내용이 정확한가, 제시된 링크가 실제로 있는 페이지로 이어지는가.

  • 이 연구들은 뉴스가 대상이지 기업 추천이 아니다.

    Tow Center의 절차는 언론 발췌의 출처를 추적하는 것이고, EBU의 절차는 기자들이 뉴스 답변을 평가하게 하는 것이다. 귀속의 기제는 같지만, 상업적 추천으로의 이전은 우리의 것이며 이 연구들이 측정한 바가 아니다.

  • 둘 다 2025년 것이고, 모델은 그 뒤로 바뀌었다.

    Tow Center는 2025년 3월, EBU와 BBC는 2025년 10월에 발표했다. 검증된 버전은 오늘 제공되는 버전이 아니며, 같은 절차를 이번 달에 하면 어떻게 될지는 어느 측정도 말하지 않는다. 우리는 다시 하지 않았다.

  • 여덟 엔진의 평균은 거대한 격차를 가린다.

    엔진에 따라 오류는 37%에서 94%까지 벌어진다. 전체의 「60% 이상」은 최악값이 끌어올린 평균이며, 이 한 숫자를 특정 엔진을 말하는 데 인용하면 잘못 읽는 것이다.

  • 우리는 둘 중 어느 것도 재현하지 않았다.

    대학 연구 센터와 공영 언론 연합이 발표한 작업을 원 출처에서 읽은 것이다. 우리의 측정이 아니며, 그렇게 내세우지도 않는다.

이것이 바꾸는 것

계기판이 아니라 인용을 읽어라.

지명되는 것과 잘 서술되는 것은 다른 결과다. 등장 횟수만 세는 대시보드는 좋은 소식과 당신에 대한 오류를 구별하지 못한다.

링크가 실제로 있는지 확인하라.

당신 도메인 위의 지어낸 주소는 증거처럼 보이지만 증거가 아니다. 엔진이 제시하는 것을 눌러 보라. 검증된 두 엔진에서는 답변의 절반이 죽은 페이지로 이어졌다.

경쟁사에 무엇이 귀속되는지 지켜보라.

오류는 양방향으로 작동한다. 당신의 논거가 다른 이름의 공으로 돌아갈 수 있고, 자기 것만 보는 모니터링에서는 그것이 보이지 않는다.

엔진의 의심에 기대지 마라.

망설이는 것보다 훨씬 자주 틀린다. 200건의 답변에서 오류 134건에 유보는 15건이었다. 말투의 확신은 내용의 정확성에 대해 아무것도 말해주지 않는다.

자주 묻는 질문

AI의 인용이 우리 회사에 해가 될 수 있나
그렇다. 그리고 그것이 가시성 계기판이 놓치는 지점이다. 공개된 연구들은 한 적 없는 주장을 출처에 귀속시킨 사례와, 존재하지 않는 페이지로 이어지는 링크를 기록한다. 브랜드로 옮기면, 답변이 당신 것이 아닌 가격이나 전문 분야나 약속을 당신에게 지우면서도 여전히 당신을 인용된 것으로 셀 수 있다는 뜻이다.
어느 엔진이 가장 정확하게 인용하나
2025년 3월 Tow Center 연구에서 Perplexity가 오답 37%로 최고였고 Grok-3가 94%로 최악이었다. 두 가지 유보가 따른다. 그 버전들은 오늘 제공되는 것이 아니며, 37%의 오류도 여전히 높은 비율이다. 그 검증 안에 통상적인 의미로 신뢰할 만한 엔진은 없었다.
AI가 우리에 대해 하는 말을 어떻게 확인하나
고객이 물을 법한 방식으로 묻고, 답변을 세 단계로 읽어라. 우리 이름이 나오는가, 우리에게 귀속된 내용이 정확한가, 제시된 링크가 실제로 있는 페이지로 이어지는가. 그리고 시간을 두고 반복하라. 어느 하루의 답변이 다음 날을 예고하지 않기 때문이다. 우리 모니터링이 하는 일이 그것이고, 손으로도 같은 일을 할 수 있다.