AI 검색의 작동 방식 · 5단계

AI 검색의 마지막 단계인 종합과 귀속에서는 무슨 일이 일어납니까?

문구가 결과를 바꿀 수 있는 유일한 단계입니다. 그래서 거의 모든 GEO 조언이 이곳을 겨냥하고, 또 그 조언의 거의 전부가 앞의 네 단계를 건너뛴 환경에서 측정됩니다.

이 페이지의 목차
이 글 공유하기
X에 공유 LinkedIn에 공유
짧은 답변

종합과 귀속은 4단계에서 선택된 패시지를 바탕으로 모델이 답변을 쓰고, 그 주장 가운데 일부에 출처 링크를 붙이는 단계입니다. 링크를 붙이는 것은 그 링크 뒤의 페이지와 문장을 대조해 확인하는 것과 같지 않습니다. 생성형 검색 엔진을 평가한 2023년 연구는 생성된 문장 가운데 평균 겨우 51.5%만이 인용으로 완전히 뒷받침된다는 것을 확인했습니다.5

핵심 요약
  • 인용은 주장에 붙은 링크이고, 언급은 답변 본문에 브랜드 이름이 나오는 것입니다. 이 둘은 수시로 어긋납니다. 가시성 점수 하나가 아니라 두 개의 열로 기록하십시오.
  • 인용되었다고 해서 정확하게 설명된 것은 아닙니다. Google AI Overviews를 대상으로 한 2026년 감사는 원자적 주장 98,020건 가운데 11.0%가 옆에 인용된 페이지로 뒷받침되지 않는다는 것을 확인했습니다. 더 큰 실패 유형은 누락이었습니다.8
  • 문구는 여기서만 작용하며, 그 대상은 리트리벌, 순위, 선택을 이미 통과한 자료입니다. 이 단계를 깨끗하게 측정한 연구는 모두 페이지를 먼저 모델의 컨텍스트에 넣었습니다. 그래서 그중 어느 것도 열린 웹을 설명하지 못합니다.
  • 모든 문장을 이웃 문장 없이도 참이 되도록 쓰십시오. 주어, 한정 조건, 수치, 날짜를 문장 안에 넣습니다.
  • 공표된 어떤 지표에서도 조작된 통계는 진짜와 같은 점수를 받습니다. 파이프라인 어디에도 검증이 없기 때문입니다. 이것이 검증을 견디는 출처가 되어야 하는 이유입니다.
정의

종합과 귀속에서는 무슨 일이 일어납니까?

모델은 선택된 패시지의 짧은 목록을 받아 그것을 바탕으로 답변을 쓰고, 그다음에 주장에서 출처로 링크를 붙입니다. 이 둘은 분리할 수 있는 작업이며, 분리된다는 점이 중요합니다. 링크가 붙기 위해 그 글이 출처의 충실한 요약일 필요는 없기 때문입니다. 이런 시스템에서 귀속은 생성된 문장과 컨텍스트에 들어 있던 문서 사이의 사후 연결이지, 그 문장이 그 문서에서 도출되었다는 검증이 아닙니다.

이것이 아래에서 다룰 정확성 문제의 전체 토대입니다. 브랜드 팀이 걸려 넘어지는 이상한 비대칭도 여기서 설명됩니다. 엔진은 본문에서 경쟁사 이름을 부르면서 내 페이지에 링크할 수도 있고, 내 페이지에 링크하면서 아무 이름도 부르지 않을 수도 있습니다. 두 출력은 서로 다른 메커니즘이 만들며, 둘이 일치해야 한다는 요구가 없기 때문입니다. 이 단계에 무엇이 도달할지를 정하는 앞의 네 단계는 AI 검색의 작동 방식에 있습니다.

두 가지 결과

언급과 인용의 차이는 무엇입니까?

인용은 엔진이 주장에 붙이는 링크이고, 언급은 답변 문장에 브랜드 이름이 나타나는 것입니다. 이 둘은 수시로 어긋나며, 소리 내어 읽었을 때 남는 것은 한쪽뿐입니다. 2026년 6월의 한 벤더 연구는 프롬프트 115건, 도메인 출현 3,981회, 플랫폼 4곳, 14개국을 대상으로, 출처 출현의 약 62%가 답변이 브랜드 이름을 한 번도 부르지 않은 링크였다고 보고했습니다. 또한 프로필이 거의 반대인 두 엔진을 제시했습니다. 한쪽은 출현의 약 84%에서 브랜드 이름을 부르면서 링크는 약 21%였고, 다른 한쪽은 이름을 부른 것이 약 21%인데 링크는 약 87%였습니다.6 표본은 작습니다. 여기서 발견된 것은 방향이지 소수점이 아닙니다.

실무적 귀결은 “AI 가시성”에 열이 하나가 아니라 둘 필요하다는 것입니다. 언급 없는 링크는 추천 트래픽을 가져오지만, 한 번도 클릭하지 않는 독자에게는 아무것도 전하지 못합니다. 링크 없는 언급은 기억을 남기고 트래픽은 남기지 않습니다. 어느 쪽이 필요한지는 발견되고 싶은지, 기억되고 싶은지에 달려 있습니다. 둘을 하나의 점수로 뭉뚱그린 리포트는 다음에 무엇을 할지 정해 주는 바로 그 구분을 버린 것입니다.

충실도

인용되면 정확하게 설명된 것입니까?

아닙니다. 그리고 측정된 오류율은 글 쓰는 방식을 바꿀 만큼 높습니다. 컬럼비아대 Tow 디지털저널리즘센터는 2024년 11월 매체 20곳에서 뽑은 인용문 200건으로 ChatGPT Search를 시험했고, 응답 200건 가운데 153건이 부분적으로 또는 전부 틀렸으며 불확실성을 밝힌 것은 7번뿐이었다는 사실을 확인했습니다.3 2025년 3월 후속 연구는 매체 20곳 × 기사 10편 × 어시스턴트 8종으로 여덟 개 엔진에 걸쳐 쿼리 1,600건을 돌렸고, 그중 60% 넘게 틀린 답을 받았습니다. 가장 나쁜 어시스턴트는 94% 확률로 틀렸고, 그 200건의 프롬프트에서 오류 페이지로 연결되는 인용을 154건 만들어 냈습니다. 라이선스 계약은 정확성에 아무런 이득을 주지 않았고, 크롤러를 차단한 매체도 여전히 인용되었습니다.4

독립적인 연구들도 다른 각도에서 같은 방향을 가리킵니다. 생성형 검색 엔진을 평가한 2023년 연구는 생성된 문장 가운데 평균 겨우 51.5%만이 인용으로 완전히 뒷받침되고, 인용 가운데 해당 문장을 뒷받침하는 것은 74.5%에 그친다는 것을 확인했습니다.5 2026년의 한 감사는 Google AI Overviews 7,491건을 원자적 주장 98,020건으로 분해해 각각을 옆에 인용된 페이지와 대조했습니다. 11.0%는 뒷받침되지 않는 것으로 나왔고, 그중 4.1%는 인용된 내용과 직접 모순되거나 충돌했으며, 나머지 7.0%는 인용된 출처 본문에서 아예 다루어지지 않았습니다.8 더 큰 실패는 모순이 아니라 누락입니다. 흔한 경우는 엔진이 내 페이지와 다투는 것이 아니라, 페이지가 한 번도 하지 않은 말을 그 페이지의 것으로 돌리는 것입니다. 또 다른 2026년 연구는 어시스턴트와 주제에 따라 71.4%에서 86.3%에 이르는 신뢰할 수 있는 출처 비율을 측정했습니다.8 방법이 다르고 분모가 다르지만 결론은 하나입니다. 문장에 링크가 붙어 있다는 사실은 그 문장이 출처에 비추어 참인지에 대해 거의 아무것도 말해 주지 않습니다.

그래서 “인용되기” 위한 최적화와 정확하게 표현되기 위한 최적화는 같지 않습니다. 당신을 보호하는 쪽은 후자입니다. 이웃 문장이 있을 때만 참인 문장은 이웃 없이 뽑혀 나갑니다.

근거

문구는 왜 이 단계에서만 작용합니까?

문구는 종합 단계에서만 작용합니다. 그 앞의 모든 단계가 어떤 패시지가 그 자리에 있는지를 이미 정해 놓았기 때문입니다. 다시 쓰는 것은 한 패시지가 답변의 얼마를 차지하는지는 바꾸지만, 애초에 리트리벌되었는지는 바꾸지 못합니다.

아래 표는 KDD 2024의 결과를 논문 자체의 지표로 보여 줍니다. 베이스라인인 “최적화 없음”은 Position-Adjusted Word Count에서 19.3점입니다. 이는 답변의 단어 가운데 내 출처로 인정된 비율이며, 인용이 늦게 나올수록 할인됩니다.1

재작성 전술전용으로 만든 엔진에서의 PAWC무엇의 근거인가
최적화 없음19.3베이스라인
키워드 채워 넣기17.7아무것도 안 하는 것보다 나쁨
출처 인용 추가24.6하류 효과만
통계 추가25.2하류 효과만
인용문 추가27.29개 중 최고, 하류 효과만

이 표의 모든 수치는 최적화된 페이지가 이미 엔진의 컨텍스트 안에 들어 있는 상태에서 나온 것입니다. 실험은 한 쿼리에 대한 Google 상위 5개 결과를 가져와 그 5개 문서를 바탕으로 GPT-3.5에 답변을 쓰게 했고, 시험 대상 페이지는 그 안에 포함되어 있었습니다.1 바로 이 설계가 5단계를 깨끗하게 측정하게 해 주는 동시에, 2단계에서 4단계까지에 대해 아무 말도 못 하게 만듭니다. 2026년 비판적 서베이는 이 연구가 뒷받침하는 인과 주장을 높음 확신도로 평가하면서, 이 근거가 “오가닉 리트리벌을 다루지 않는다”고 적어 두었습니다. 그리고 논문의 대표 수치를 일반화하는 통념은 “특정 구성에서 한 지표의 상대적 최댓값일 뿐”이라며 따로 기각했습니다.2

비싸지는 지점은 단계들을 곱했을 때입니다. 문서 171,003건과 쿼리 2,700건에서 리트리벌과 재순위화를 되살린 2026년 KDD 벤치마크는, 본문만 손대는 최적화가 평균 상위 20위 노출을 약 9%, 재순위화 이후 상위 10위 노출을 16%, 최종 인용을 약 6% 낮춘다고 측정했습니다.7 3단계의 손실로 산 5단계의 이득은 결국 손실입니다. 문구는 마지막에 당기는 레버이고, 가장 부드럽게 당겨야 할 레버입니다.

어두운 쌍둥이

이 단계는 어떤 실패를 부릅니까?

조작된 귀속, 즉 실제 출처 없이 인용처럼 보이는 텍스트는 5단계가 만들어 내는 고유한 유혹이며, 이 분야의 출발점이 된 논문이 그것을 우연히 실연했습니다. “출처 인용” 전술의 예시 출력은 존재하지 않는 것으로 보이는 기관이 수행한 설문을 근거로 들고, 그 예시에 132.4%의 상대적 개선이라는 점수를 매겼습니다.1 거기서 조작적으로 정의된 전술은 “인용처럼 생긴 텍스트를 더하기”이지 “진짜 인용을 더하기”가 아닙니다. 파이프라인 어디에서도 검증하지 않기 때문에 지표는 그 차이를 구별하지 못합니다.

2026년 서베이는 이 문제를 한 문장으로 지목합니다. “조작된 통계를 더하면 재사용은 늘어나는 반면 인식적 품질은 떨어질 수 있다. 따라서 기준은 ‘숫자를 더하는 것’이 아니라 관련성 있고, 검증 가능하며, 날짜가 있고, 출처가 제대로 밝혀진 근거를 제시하는 것이다.”2 같은 서베이는 변호사 없이도 적용할 수 있는 형태로 경계도 그어 둡니다. 판정 기준은 상업적 의도가 공개되었는지, 그리고 경쟁사가 조작된 비방 없이 묘사되었는지입니다. 이 기준으로 보면 문단을 재배치하거나 검증된 1차 출처를 더하는 것은 통과하고, 심어 놓은 후기나 모델이 나를 편들게 하려고 쓴 지시문은 통과하지 못합니다.2

결정을 내려 줄 것은 이 비대칭입니다. 이름과 날짜와 링크가 있는 출처를 단 진짜 수치는 지어낸 수치와 똑같은 추출 이득을 얻으면서 책임 위험은 전혀 지지 않습니다. 게다가 여덟 개 엔진에 걸친 1,600건 쿼리 테스트에서 이미 60% 넘게 틀린 답이 돌아온 분야입니다. 검증을 견디는 출처가 되는 것은 전술이 아니라 오래가는 자리입니다.4

적용

그래서 실제로 무엇을 써야 합니까?

인용되기를 바라는 문장은 모두 주변 맥락이 없어도 참이 되도록 쓰십시오. 주어와 한정 조건과 날짜를 문장 안에 넣습니다. “이것은 작년에 30% 올랐다”가 아니라 “Findings of ACL 2026에 실린 연구에서 쿼리 4,706건에 걸쳐 측정한 결과, Google AI Overview가 참조하는 도메인의 평균 53%는 오가닉 상위 10위 안에 나타나지 않는다”라고 씁니다.9 두 번째 문장은 뽑혀 나가도 살아남습니다. 첫 번째 문장은 당신이 하지 않은 주장이 되어 당신에게 귀속되고, 게다가 수정할 수 없는 답변 안에 남습니다.

합리적으로 권할 수 있는 것에 대한 서베이 자체의 요약은 대부분의 GEO 체크리스트보다 짧습니다. “관련성 있고, 포괄적이며, 검증 가능하고, 구조가 분명하며, 기술적으로 리트리벌 가능한 페이지를 만들라. 그런 다음 리트리벌, 인용, 충실도를 따로 측정하라.”2 핵심은 “따로”입니다. 가시성을 하나로 섞은 숫자로는 셋 중 무엇이 움직였는지 알 수 없기 때문입니다. 같은 서베이는 감사에서 인용률을 어조, 귀속 정확도, 사실 뒷받침을 포괄하는 매트릭스와 짝지으라고 요구합니다. 이것이 이 단계가 보상하는 세 열짜리 습관입니다.

그다음에는 5단계 작업을 분수에 맞게 유지하십시오. 근거 기반은 파이프라인에서 가장 좁고, 효과는 하류에서만 측정되었습니다. 서베이는 권위적인 어조를 약하고 불안정하다고 평가하며, 뽑아낼 수 있는 근거, 즉 실제 수치와 정의와 비교는 참이고 출처가 밝혀져 있으며 의도에 맞는다는 조건에서 중간에서 강함으로 평가합니다.2 이 단계에서 방어할 수 있는 조언은 이것이 전부입니다. “AI를 위한 글쓰기”라는 이름으로 팔리는 나머지는 이 말의 다른 표현이거나, 근거가 없습니다.

이 글의 솔직한 한계

이 글에 실린 5단계 측정 결과는 모두 문서가 이미 모델의 컨텍스트 안에 있는 설정에서 나온 것입니다. 지금까지 그 단계를 분리해 내는 방법은 그것뿐이기 때문입니다. 이 수치들 가운데 어느 것도 열린 웹에 있는 페이지에 무슨 일이 생기는지 말해 주지 않으며, 앞 단계를 되살린 유일한 벤치마크에서는 곱한 결과가 마이너스였습니다. 지표 자체도 당신이 신경 쓰는 성과가 아닙니다. 그것은 답변 단어에서 차지하는 비율을 셀 뿐이고, 2026년 비판적 서베이는 인용 점수가 클릭이나 전환이나 매출을 예측한다는 주장을 매우 낮음 확신도로 평가합니다. 언급 대 인용의 갈라짐은 프롬프트 115건짜리 벤더 표본에 기대고 있어서, 격차가 있다는 것을 보여 주기에는 충분하지만 그 크기를 재기에는 부족합니다.

제품이 쓸모 있는 곳과 그렇지 않은 곳

이 단계를 점검하는 데 소프트웨어는 필요 없습니다. 필요한 것은 끈기입니다. 각 엔진에 구매자의 질문을 던지고, 답변마다 세 가지를 따로 기록하십시오. 내 페이지가 링크되었는지, 본문에서 브랜드 이름이 불렸는지, 그리고 답변이 나에 대해 말한 내용이 실제로 사실이었는지입니다. 세 번째 열은 아무도 남기지 않는 열이며, 고객보다 먼저 잘못된 설명을 잡아내는 열입니다. Bavior가 자동화하는 것은 수집이지 판단이 아닙니다. 고정된 프롬프트 세트를 다섯 개 엔진에 일정에 따라 돌리고, 실행마다 인용된 출처를 기록합니다. 인용된 출처가 진행 중인 토론 스레드일 때는 당신이 관리하는 계정으로 답글 초안을 작성하며, 무엇이든 게시되기 전에 당신이 승인하거나 수정하거나 거부합니다. 페이지를 대신 써 주지 않고, 답변이 나에 대해 말한 내용을 검증하지 않으며, 나를 잘못 설명하는 엔진을 바로잡을 수도 없습니다. 무료 AI 가시성 점검무료 GEO 감사는 유료 플랜 없이 이용할 수 있습니다. 유료 플랜은 월 결제 시 월 $99부터, 연 결제 시 월 $79.17입니다(2026년 8월 29일 기준).

출처, 모두 2026년 8월 30일 확인
  1. Aggarwal, Murahari, Rajpurohit, Kalyan, Narasimhan, Deshpande, 「GEO: Generative Engine Optimization」, KDD 2024, arXiv:2311.09735: arxiv.org/abs/2311.09735
  2. 「Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)」, 2026년 7월 15일, arXiv:2607.14035(서베이 프리프린트): arxiv.org/abs/2607.14035
  3. 컬럼비아대 Tow 디지털저널리즘센터, 「How ChatGPT Search (Mis)represents Publisher Content」, 2024년 11월: cjr.org
  4. Jaźwińska, Chandrasekar(Tow 센터), 「AI Search Has a Citation Problem」, 2025년 3월 6일. 여덟 개 엔진에 걸친 쿼리 1,600건: cjr.org
  5. Liu, Zhang, Liang, 「Evaluating Verifiability in Generative Search Engines」, 2023. 생성된 문장 가운데 인용으로 완전히 뒷받침된 것 51.5%, 해당 문장을 뒷받침하는 인용 74.5%: arxiv.org/abs/2304.09848
  6. 고스트 인용 연구, 2026년 6월. 프롬프트 115건, 도메인 출현 3,981회, 플랫폼 4곳, 14개국. 인용의 약 62%는 답변 본문에서 브랜드 이름이 한 번도 불리지 않은 링크였습니다. 벤더가 공표한 자료이며, 이 커리큘럼의 출처 규칙에 따라 링크하지 않고 설명만 합니다.
  7. Kim 외, 「SAGEO Arena: A Realistic Environment for Evaluating Search-Augmented Generative Engine Optimization」, KDD 2026(arXiv:2602.12187v2, 2026년 8월 7일). 문서 171,003건에 대한 쿼리 2,700건: arxiv.org/abs/2602.12187
  8. Xu, Iqbal, Montgomery, 「Measuring Google AI Overviews」, 2026(프리프린트). 원자적 주장 98,020건 가운데 11.0%가 인용된 페이지로 뒷받침되지 않음: arxiv.org/abs/2605.14021. 71.4~86.3%의 신뢰할 수 있는 출처 비율은 Vykopal 외 2026의 것이며, 출처 2의 서베이에 보고된 내용입니다.
  9. Kirsten, Große Perdekamp, Wu, Upadhyay, Gummadi, Zafar, 「Characterizing Web Search in The Age of Generative AI」, Findings of ACL 2026, 10827~10848쪽. 쿼리 4,706건, AI Overview 도메인의 53%가 오가닉 상위 10위 밖: aclanthology.org/2026.findings-acl.526
FAQ

자주 묻는 질문입니다.

왜 AI 답변은 내 사이트에 링크하면서 브랜드 이름은 한 번도 말하지 않습니까?

답변 본문과 붙는 링크가 서로 다른 작업으로 만들어지고, 둘이 일치해야 한다는 요구가 없기 때문입니다. 2026년 6월 벤더 연구는 플랫폼 4곳에 걸친 프롬프트 115건과 도메인 출현 3,981회를 조사해, 출처 출현의 약 62%가 본문에서 브랜드 이름을 한 번도 부르지 않은 링크였다고 보고했습니다. 엔진 간 차이도 매우 컸습니다. 한쪽은 출현의 약 84%에서 브랜드 이름을 불렀지만 링크는 약 21%였고, 다른 한쪽은 거의 그 반대였습니다. 링크와 이름이 불린 언급은 별개의 두 열로 추적하십시오. 전달하는 것이 다르기 때문입니다. 하나는 트래픽을, 다른 하나는 기억을 가져옵니다.

AI 엔진이 내 페이지를 인용했다면, 나를 정확하게 설명한 것입니까?

아닙니다. 링크가 붙은 것은 검증된 것이 아니며, 측정된 오류율은 높습니다. 컬럼비아대 Tow 센터는 2024년 11월 ChatGPT Search 응답 200건 가운데 153건이 부분적으로 또는 전부 틀렸다는 것을 확인했습니다. 2025년 3월 후속 연구에서는 여덟 개 엔진에 걸친 쿼리 1,600건 가운데 60% 넘게 틀린 답이 돌아왔고, 한 어시스턴트는 94% 확률로 틀렸습니다. 2023년 평가에서는 생성형 검색 답변의 문장 가운데 붙어 있는 인용으로 완전히 뒷받침된 것이 51.5%뿐이었습니다. 방어책은 주변 맥락 없이 인용되어도 참이 되도록 문장을 하나씩 쓰는 것입니다.

페이지에 통계와 인용문을 더하면 AI 인용이 늘어납니까?

깨끗하게 측정된 유일한 환경에서는 늘어납니다. 다만 그 환경은 리트리벌을 완전히 건너뛰었습니다. KDD 2024 논문은 Position-Adjusted Word Count 지표에서 인용문 추가를 27.2, 통계 추가를 25.2로 매겼고, 베이스라인은 19.3이었으며, 최적화된 페이지는 이미 엔진의 5개 문서 컨텍스트 안에 있었습니다. 리트리벌과 재순위화를 되살린 2026년 벤치마크에서는 본문만 손대는 최적화가 상위 20위 노출을 약 9%, 최종 인용을 약 6% 낮췄습니다. 실제이고 날짜가 있고 출처가 밝혀진 수치는 더할 가치가 있습니다. 페이지의 주제 관련성을 희석하는 재작성은 그렇지 않습니다.

AI 검색을 위해 권위적인 어조로 쓸 가치가 있습니까?

2026년 비판적 서베이는 권위적인 어조를 약하고 불안정한 뒷받침으로 평가하고, 신뢰성과 충돌할 수 있다고 경고합니다. 이 분야에서 평가가 가장 낮은 레버 가운데 하나입니다. 같은 서베이가 중간에서 강함으로 평가하는 것은 뽑아낼 수 있는 근거입니다. 실제 수치, 명확한 정의, 분명한 비교이며, 참이고 출처가 밝혀져 있고 쿼리 의도에 맞는다는 조건이 붙습니다. 실무로 옮기면, 이름이 있는 출처와 날짜를 갖춘 담담한 문장이 둘 다 없는 자신만만한 문장을 이깁니다. 그리고 그 문장은 자신만만한 표현이 통과하지 못하는 정확성 검사를 통과합니다.

Bavior 편집팀

Reddit 마케팅과 AI 검색 가시성에 관한 Bavior의 콘텐츠를 조사하고 관리하는 팀입니다. 본문의 모든 수치에는 출처와 확인 날짜를 명시했으며, 제휴 링크는 사용하지 않습니다.

수치에 오류를 발견하셨나요? 알려주시면 다시 확인하겠습니다: support@bavior.com

인용된 것과 정확하게 설명된 것은 다릅니다.
둘 다 확인하십시오.

무료 체험 시작