이 네 숫자는 같은 것을 재지 않으며, 숫자 사이의 간격은 모순이 아니라 정보입니다. Tow Center의 두 연구가 재는 것은 귀속입니다. 한 대목을 주었을 때 엔진이 올바른 매체를 지목하고 올바른 기사에 링크하는가입니다. 문장 단위와 주장 단위 연구가 재는 것은 함의입니다. 그 문장에 달린 출처가 실제로 그 진술을 뒷받침하는가입니다. 귀속은 대부분 실패하고 함의는 상당한 소수에서 실패하는데, 이는 작동 방식과 들어맞습니다. 모델은 읽은 자료로 유창하게 쓴 다음, 나중에 출처를 붙이기 때문입니다.
AI 인용 정확도: 인용되는 것과 정확하게 설명되는 것은 같지 않습니다.
이 주제에 관한 독립 연구는 이례적으로 명확하고 이례적으로 나쁩니다. 무엇을 써야 하는지가 달라집니다. 엔진이 여러분의 페이지에서 뽑아 가는 문장은, 그 문장을 참으로 만들어 주던 문단 없이 읽히기 때문입니다.
이 페이지의 내용
인용되는 것과 정확하게 설명되는 것은 같지 않고, 그 격차를 잰 독립 측정은 모두 격차가 크다고 보고했습니다. 인용은 엔진이 여러분의 페이지를 관련 있다고 판단했다는 증거로만 다루십시오. 링크 옆의 문장이 참이라는 증거로는 결코 다루지 마십시오. 컬럼비아대 Tow 디지털 저널리즘 센터는 2024년 11월에 매체 20곳에서 뽑은 인용문 200건을 ChatGPT Search에 넣었고, 부분적으로 또는 전부 틀린 답변을 153번 받았습니다. 시스템이 답할 수 없다고 인정한 것은 7번뿐이었습니다.1
핵심 요약AI 답변이 인용한 출처를 잘못 설명하는 빈도는 얼마나 되나
인용이 정확한 설명의 증거가 되지 못할 만큼 자주 일어납니다. Tow Center의 2025년 3월 테스트에서 여덟 개 엔진에 걸쳐 60%가 넘는 답변이 틀렸습니다.
네 건의 독립 측정, 세 가지 다른 방법, 모두 같은 방향을 가리킵니다. 어느 것도 벤더 연구가 아닙니다.
Tow Center, 2024년 11월
매체 20곳에서 뽑은 직접 인용문 200건을 하나씩 ChatGPT Search에 넣고 출처를 지목하게 했습니다. 답변 153건이 부분적으로 또는 전부 틀렸고, 시스템이 답할 수 없다고 인정한 것은 7번뿐이었습니다.1
Tow Center, 2025년 3월
매체 20곳에서 각 10편의 기사를 뽑아 엔진 8개를 대상으로 쿼리 1,600건을 만들었습니다. 60%가 넘는 답변이 틀렸습니다. 가장 성적이 좋은 엔진도 37%는 틀렸고, 가장 나쁜 엔진은 94%가 틀렸으며, 받은 프롬프트 200건 가운데 인용 154건이 오류 페이지로 이어졌습니다.2
문장 단위 뒷받침, 2023년
이 시스템들에 대한 최초의 체계적 검증 가능성 평가에서, 생성형 검색 답변의 문장 가운데 51.5%만이 거기 달린 인용에 완전히 뒷받침됐습니다.3
원자적 주장, 2026년
트렌딩 쿼리 55,393건을 40일간 조사한 연구는 Google AI Overview 답변을 원자적 주장 98,020건으로 분해했고, 그중 11.0%가 옆에 인용된 페이지에 뒷받침되지 않는다는 것을 확인했습니다.4
오류는 실제로 어떤 모습인가
독립 연구에는 서로 다른 네 가지 실패 유형이 나타나며, 각각 다른 대응이 필요합니다. 첫째는 자신만만한 잘못된 귀속입니다. 답변이 그런 말을 한 적 없는 출처를 지목합니다. Tow Center의 2024년 11월 테스트에서 ChatGPT Search는 시도 200번 가운데 7번만 말을 흐렸습니다. 틀린 답변이 맞는 답변과 똑같은 어조로 도착했다는 뜻입니다.1
둘째는 끊어진 인용입니다. 2025년 3월 연구가 Grok 3에 준 프롬프트 200건 가운데 인용 154건이 오류 페이지로 이어졌습니다. 증거처럼 보이지만 아무 데도 닿지 않는 링크입니다.2 셋째는 부분적 뒷받침입니다. 주장은 대체로 맞고 출처도 실재하지만, 문장 속의 구체적인 숫자나 한정 조건이 출처에 없습니다. 이것이 브랜드에 가장 아픕니다. 독자 눈에는 보이지 않으면서, 자사의 가격과 한도와 기능에 대해 여러분이 한 적 없는 그럴듯한 주장을 만들어 내기 때문입니다.
넷째는 복합물입니다. 엔진이 1차 출처를 가져오지 못하면, 그것을 다루는 다른 온갖 것에서 답변을 조립합니다. Tow Center가 2025년 10월에 관찰한 것이 바로 이것입니다. 매체가 크롤러를 차단해 두자, 에이전트는 그 기사에 관한 트윗, 전재본, 다른 매체의 인용, 관련 보도를 끌어모아 복합 요약을 만들어 냈습니다.5 그 출력은 여러분에 대한 설명처럼 보입니다. 실제로는 다른 사람들이 여러분에 대해 말한 것에 대한 설명입니다.
인용됐다면 그 출처는 신뢰할 만한가
아닙니다. 이 분야의 2026년 비판적 서베이는 이 결론에 별도의 절 제목을 붙였습니다. 인용은 신뢰성도 뒷받침도 의미하지 않는다는 것입니다.7
신뢰성과 뒷받침은 따로 측정되며, 둘 다 결과가 엇갈립니다. 동료 심사를 거친 EACL 2026 챗 어시스턴트 연구는 신뢰할 만한 출처 비율이 어시스턴트와 주제에 따라 71.4%에서 86.3% 사이라고 관찰했습니다. 일부 GPT 구성에서는 Perplexity나 Qwen보다 잘못된 정보 출처가 더 많았습니다.8 뒤집어 읽으면, 답변 뒤에 있는 출처의 약 14%에서 29%는 이 연구의 신뢰 집합 밖에 있었습니다.
이 풀은 읽어내기도 점점 어려워지고 있습니다. 정치, 건강, 환경에 관한 실제 질문 712건으로 ChatGPT, Copilot, Gemini, Perplexity를 감사한 결과, 네 엔진 모두에서 AI가 생성한 출처가 인용된 증거가 나왔고 그 비율은 인용된 출처의 약 16%였습니다.9 이는 목표를 바꿉니다. 검증된 서고 안에서 가장 자주 언급되기를 다투는 것이 아닙니다. 여러분의 카테고리를 설명하는 합성 페이지가 이미 섞여 있는 풀에서, 어떤 사실에 대해 가장 명확하고 정확한 1차 진술이 되는 것을 노려야 합니다.
라이선스 계약이나 크롤러 차단이 보호해 주나
이 질문을 다룬 유일한 독립 테스트에서 둘 다 통하지 않았습니다. Tow Center의 2025년 3월 연구는 그해 2월에 진행한 테스트에서 라이선스 계약이 정확성에 아무런 이득을 주지 않았고, 크롤러를 차단한 매체도 결국 인용됐다고 보고합니다. Perplexity 무료 버전은 페이월이 걸린 National Geographic 기사에서 뽑은 발췌문 10건을 모두 정확히 지목했습니다. 그 매체는 Perplexity의 크롤러를 허용하지 않으며 그 회사와 공식 관계도 없습니다.2 계약은 충실성을 사 주지 못하고, robots.txt 규칙은 부재를 사 주지 못합니다.
2025년 10월 후속 조사는 차단이 왜 역효과를 내는지 구체적으로 보여 줬습니다. 에이전트형 브라우저, 곧 사용자를 대신해 실제 브라우저를 구동하는 Chromium 세션은 9,000단어짜리 구독자 전용 기사의 전문을 가져왔습니다. ChatGPT와 Perplexity의 표준 인터페이스는 같은 요청을 거부했습니다. 매체가 그 두 회사의 크롤러를 차단해 두었기 때문입니다.5 차단이 바꾸는 것은 어떤 출처가 여러분을 설명하는가입니다. 답변에서 여러분을 지워 주지 않으며, 대개는 설명을 더 나쁘게 만듭니다.
방어 가능한 자세는 벽과 정반대입니다. 가져오기와 인용이 가장 쉬운 정확한 출처가 되고, 엔진이 질문받게 될 사실들을 날짜가 붙은 서버 렌더링 텍스트로 자기 도메인에 두는 것입니다.
여기 실린 강한 정확성 근거는 모두 2024년 11월과 2025년 3월 사이에 만들어진 뉴스 매체 테스트 세트에서 나왔습니다. 뉴스 귀속은 SaaS 제품의 가격 페이지를 설명하는 것보다 어려운 과제입니다. AI 답변이 기업 자신의 제품 사실을 얼마나 자주 잘못 진술하는지 측정한 독립 연구는 없습니다. 그러니 위의 오류율은 잘못된 설명이 흔하고 예측하기 어렵다는 근거로 읽어야 하며, 여러분 브랜드에 적용되는 비율로 읽어서는 안 됩니다. 뒤이어 나오는 글쓰기 조언도 상관관계에 머뭅니다. 뽑혀 나간 문단이 어떤 모습인지에서 나온 것이지, 그렇게 쓰면 정확히 인용된다는 것을 보여 준 통제 시험에서 나온 것이 아닙니다.
단독으로 인용돼도 무너지지 않는 문장은 어떻게 쓰나
주어와 한정 조건과 날짜를 문장 자체에 넣어, 페이지를 걷어내도 그 문장이 참으로 남게 하십시오. 1년치 AI Mode 인용 1,570만 건 데이터셋은 하이라이트된 문단 460만 건으로 해소됐고, 길이의 중앙값은 117단어였으며, 그중 약 85%는 완전히 자족적이었고 80%는 첫 문장에서 답을 냈습니다.6
추출을 견딤
- “Bavior의 엔트리 플랜은 2026년 8월 29일 기준 월 결제 시 월 $99입니다.” 주어, 숫자, 과금 기준, 날짜가 모두 한 문장 안에 있습니다.
- “쿼리 팬아웃은 하나의 질문을 하위 주제에 걸친 여러 번의 검색으로 넓히는 것이며, Google이 AI Overviews와 AI Mode에 대해 문서화했습니다.” 귀속을 붙인 담백한 정의입니다.
- “Findings of ACL 2026에 실린 4,706건 쿼리 감사에서, Google AI Overviews가 참조한 도메인의 53%는 오가닉 상위 10위 안에 없었습니다.” 표본, 발표 지면, 수치, 범위가 한 줄에 담깁니다.
잘못 인용됨
- “이는 $99가 든다는 뜻입니다.” 지시 대상도, 과금 주기도, 날짜도 모두 앞 문단에 있고, 앞 문단은 함께 따라가지 않습니다.
- “위에서 봤듯이 인용 대부분은 상위 10위 밖에서 옵니다.” 구조적으로 인용할 수 없습니다. 주어도, 출처도, 범위도 없습니다.
- “연구에 따르면 40% 개선됩니다.” 연구 이름도, 지표도, 조건도 없습니다. 게다가 이 분야의 2026년 서베이는 이 수치를 일반적 주장으로는 쓸 수 없다고 분류하며, 특정 구성에서 한 지표에 나타난 상대적 최댓값이라고 말합니다.7
이 규칙은 어떤 문장에도 5초 만에 적용할 수 있는 테스트로 일반화됩니다. 페이지의 다른 문장을 전부 지우고 그 문장을 다시 읽으십시오. 그래도 참이고, 귀속할 수 있고, 여전히 올바른 주어에 관한 것이라면 추출을 견딥니다. 위 문단이 있어야 한다면, 언젠가 엔진은 그 문단 없이 인용할 것이고, 그렇게 만들어진 주장은 여러분이 하지 않았지만 한 것으로 보이게 됩니다.
이 조언에는 두 가지 주의가 따릅니다. 첫째, 인용되기 좋은 글쓰기는 참된 글쓰기와 같지 않습니다. 2026년 비판적 서베이는 날조한 통계를 넣으면 재사용은 늘어나면서 인식적 품질은 떨어질 수 있다고 밝히며, 기준은 숫자의 유무가 아니라 관련 있고 검증 가능하며 날짜가 붙고 제대로 귀속된 근거라고 말합니다.7 둘째, 이 가운데 어느 것도 리트리벌되지 않는 페이지를 구해 주지 못합니다.
엔진이 나를 잘못 설명하면 무엇을 할 수 있나
바라는 것보다는 적고, 쓸모 있는 행동은 모두 간접적입니다. 주요 엔진에는 정정 창구가 없고, 제품에 관한 틀린 문장을 다루는 티켓 대기열도 없으며, 공개된 처리 기간도 없습니다. 할 수 있는 일은 답변이 조립되는 재료를 바꾸고 재크롤링을 기다리는 것입니다.
실제로는 네 가지 동작입니다. 다툼이 있는 사실을 자기 도메인의 평범한 서버 렌더링 텍스트로 올리되, 주어와 날짜를 스스로 지닌 문장으로 씁니다. 틀리게 답한 엔진이 그 페이지를 실제로 가져올 수 있는지 확인하고, 학습 토큰이 아니라 검색 토큰을 보십시오. 어느 벤더든 둘을 따로 문서화합니다. 틀린 답변이 실제로 무엇을 인용했는지 보십시오. 오류가 서드파티 페이지나 오래된 토론 스레드에서 왔다면 고칠 자리는 여러분의 사이트가 아니라 거기입니다. 그리고 오류를 날짜, 엔진, 프롬프트와 함께 기록하십시오. 틀린 답변 하나는 분포에서 한 번 뽑은 것일 뿐이라, 그것이 체계적인지 알려면 반복이 필요하기 때문입니다.
기대치는 정직하게 잡으십시오. 이 일은 느리고 부분적이며 보장이 없습니다. 잘못된 설명이 흔하다는 것을 보여 주는 바로 그 근거가, 계약도 차단도 그것을 고치지 못했음을 보여 줍니다. 현실적인 목표는 정확한 버전을 가장 인용하기 쉬운 것으로 만드는 일이며, 이는 AI 검색의 작동 방식 단계가 파이프라인의 다른 모든 곳에서 권하는 작업과 같습니다.
위의 내용은 전부 도구 없이 할 수 있습니다. 자족적인 문장을 쓰고, 사실을 서버 렌더링 텍스트에 두고, 틀린 답변을 스프레드시트에 기록하면 됩니다. Bavior가 돕는 것은 기록하는 쪽 절반뿐입니다. 정해진 프롬프트 묶음을 다섯 개 엔진에 정기적으로 돌리고 각 답변이 어떤 출처를 인용했는지 기록합니다. 그래서 잘못된 설명이 반복되는지 한 번뿐이었는지 알 수 있습니다. 엔진을 정정할 수 없고, 나쁜 답변을 철회시킬 수 없으며, 답변 본문이 사실로 맞는지 판정하지도 않습니다. 어떤 제품도 하지 못합니다. 무료 AI 가시성 체커와 무료 GEO 진단은 유료 플랜 없이 이용할 수 있습니다. 유료 추적은 월간 결제 시 월 $99부터, 연간 결제 시 월 $79.17입니다(2026년 8월 29일 기준).
- 컬럼비아대 Tow 디지털 저널리즘 센터, “How ChatGPT Search (Mis)represents Publisher Content”, 2024년 11월 27일; 인용문 200건, 매체 20곳; ChatGPT는 “returned partially or entirely incorrect responses on a hundred and fifty-three occasions, though it only acknowledged an inability to accurately respond to a query seven times” · cjr.org
- Jaźwińska와 Chandrasekar, Tow Center, “AI Search Has a Citation Problem”, 2025년 3월 6일; 쿼리 1,600건, 매체 20곳, 엔진 8개; 60% 넘게 오류; “Out of the 200 prompts we tested for Grok 3, 154 citations led to error pages” · cjr.org
- Liu, Zhang, Liang, “Evaluating Verifiability in Generative Search Engines”, 2023; “on average, a mere 51.5% of generated sentences are fully supported by citations” · arxiv.org/abs/2304.09848
- Xu, Iqbal, Montgomery, “Measuring Google AI Overviews”, 2026년 5월 13일(프리프린트); 트렌딩 쿼리 55,393건, 40일간; “decomposing responses into 98,020 atomic claims, 11.0% are unsupported by the cited pages” · arxiv.org/abs/2605.14021
- Chandrasekar와 Jaźwińska, Tow Center / CJR, “How AI browsers sneak past blockers and paywalls”, 2025년 10월 30일 · cjr.org
- 148개 업종에 걸친 1년치 AI Mode 인용 15,699,298건 데이터셋. 270만 페이지의 하이라이트된 문단 460만 건으로 해소, 2026년 7월; 문단 길이 중앙값 117단어, 약 85%가 자족적, 80%가 첫 문장에서 답변. 벤더가 발표한 자료여서 이 커리큘럼의 출처 규칙에 따라 링크하지 않고 설명만 합니다.
- “Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)”, 2026년 7월 15일, arXiv:2607.14035(서베이 프리프린트); 8.3절의 제목은 “Citation Implies Neither Credibility nor Support”이며, 확신도 표는 40%라는 가시성 수치를 일반적 주장으로는 기각하고 “a relative maximum on one metric under a specific configuration”이라고 말합니다 · arxiv.org/abs/2607.14035
- Vykopal, Pikuliak, Ostermann, Šimko, “Assessing Web Search Credibility and Response Groundedness in Chat Assistants”, EACL 2026, pp. 2539–2560; 신뢰할 만한 출처 비율은 어시스턴트와 주제에 따라 71.4–86.3% · aclanthology.org/2026.eacl-long.115
- Allaham와 Diakopoulos, “Synthetic Sources? Auditing Generative Search Engine Citations for Evidence of AI-Generated Sources”, 2026년 5월 22일(프리프린트); 엔진 4개, 쿼리 712건; “evidence of AI-generated sources being cited across all four generative search engines (~16% of cited sources)” · arxiv.org/abs/2605.23684
자주 묻는 질문입니다.
AI 엔진이 내 페이지를 인용하면 그 답변은 내 페이지를 정확하게 설명한 것인가요
믿을 만하지 않습니다. Tow Center는 2024년 11월에 매체 20곳의 인용문 200건으로 ChatGPT Search를 시험했고, 답변 153건이 부분적으로 또는 전부 틀렸으며 시스템이 답할 수 없다고 인정한 것은 7번뿐이었습니다. 2025년 3월 후속 연구는 쿼리 1,600건과 엔진 여덟 개에서 60%가 넘는 답변이 틀렸다는 것을 확인했습니다. 별개로, 생성형 검색 답변의 문장 가운데 51.5%만이 거기 달린 인용에 완전히 뒷받침됐습니다. 인용은 관련성의 증거로 다루고, 정확한 설명의 증거로는 결코 다루지 마십시오.
AI 크롤러를 차단하면 엔진이 제 제품을 잘못 설명하는 것을 막을 수 있나요
아닙니다. 대개는 설명이 더 나빠집니다. Tow Center의 2025년 3월 연구는 크롤러를 차단한 매체도 여전히 인용됐고, 라이선스 계약도 정확성에 이득을 주지 못했다는 것을 확인했습니다. 2025년 10월 후속 연구는 차단이 실제로 통할 때 무슨 일이 벌어지는지 보여 줬습니다. 엔진은 대신 트윗, 전재본, 서드파티 보도로 복합 답변을 조립했습니다. 차단은 여러분이 설명되는지 여부가 아니라 어떤 출처가 여러분을 설명하는지를 바꿉니다. 게다가 에이전트형 브라우저는 평범한 Chromium 세션이라 robots.txt 규칙이 닿지 않습니다.
AI 답변이 저를 정확하게 인용하게 하려면 어떻게 써야 하나요
인용되길 바라는 문장은 모두, 페이지 전체가 지워져도 참으로 남도록 쓰십시오. 주어와 한정 조건과 날짜를 문장 안에 넣으십시오. “이는 $99가 든다는 뜻입니다”가 아니라 “2026년 8월 29일 기준, 저희 엔트리 플랜은 월 결제 시 월 $99입니다”라고 씁니다. 1년치 AI Mode 인용 1,570만 건 데이터셋은 하이라이트된 문단 460만 건으로 해소됐고, 길이의 중앙값은 117단어, 그중 약 85%는 완전히 자족적이었으며 80%는 첫 문장에서 답을 냈습니다. 이 패턴은 상관관계지만, 막으려는 실패는 가정이 아닙니다.
인용됐다는 것은 엔진이 신뢰할 만한 출처를 골랐다는 뜻인가요
아닙니다. 동료 심사를 거친 EACL 2026 챗 어시스턴트 연구는 신뢰할 만한 출처 비율을 어시스턴트와 주제에 따라 71.4%에서 86.3%로 측정했습니다. 이는 답변 뒤에 있는 출처의 약 14%에서 29%가 그 신뢰 집합 밖에 있었다는 뜻입니다. 별도의 2026년 감사는 실제 질문 712건으로 ChatGPT, Copilot, Gemini, Perplexity를 살폈고 네 엔진 모두에서 AI가 생성한 출처의 증거를 찾았으며 그 비율은 인용된 출처의 약 16%였습니다. 신뢰성과 정확한 뒷받침은 별개의 속성이고, 인용은 둘 중 어느 것도 보장하지 않습니다.
우리 회사에 관한 틀린 답변을 AI 엔진이 고치게 할 수 있나요
주요 엔진에는 정정 창구가 없어서 현실적인 경로는 간접적이고 느립니다. 다툼이 있는 사실을 자기 도메인의 평범한 서버 렌더링 텍스트로, 자족적이고 날짜가 붙은 문장으로 올리십시오. 틀리게 답한 엔진이 그 페이지를 실제로 가져올 수 있는지 확인하되 학습 토큰이 아니라 검색 크롤러 토큰을 보십시오. 틀린 답변이 무엇을 인용했는지 보십시오. 오류는 여러분 사이트가 아니라 서드파티 페이지에 있는 경우가 많습니다. 그리고 오류를 엔진, 프롬프트, 날짜와 함께 기록해 두면 체계적인 문제와 운 나쁜 한 번의 추출을 구분할 수 있습니다.
출처를 인용하는 데 가장 정확한 AI 엔진은 어디인가요
시험한 여덟 개 엔진 모두 나빴고, 그 순위는 의사결정에 쓰기에는 이미 낡았습니다. Tow Center의 2025년 3월 쿼리 1,600건 연구에서 가장 성적이 좋은 엔진도 37%는 틀린 답변을 냈고, ChatGPT는 기사 134편을 잘못 지목하면서 답변 200건 가운데 확신이 낮다고 신호한 것은 15번뿐이었으며, 가장 나쁜 엔진은 94%가 틀렸고 프롬프트 200건에 걸친 인용 가운데 154건이 오류 페이지로 이어졌습니다. 엔진 동작은 몇 달 안에 바뀌므로, 이 결과는 순위표가 아니라 “잘못된 설명은 어디서나 흔하다”로 다루십시오.
Reddit 마케팅과 AI 검색 가시성에 관한 Bavior의 콘텐츠를 조사하고 관리하는 팀입니다. 본문의 모든 수치에는 출처와 확인 날짜를 명시했으며, 제휴 링크는 사용하지 않습니다.
수치에 오류를 발견하셨나요? 알려주시면 다시 확인하겠습니다: support@bavior.com