/GEO 배우기/엔진이 인용하는 것
AI 인용을 위한 콘텐츠 · 단위

AI 엔진이 실제로 인용하는 것은 페이지인가, 구절인가?

AI 인용을 위한 콘텐츠에서 이 뒤에 오는 모든 것이 이 답에 달려 있습니다. 엔진이 가져가는 것이 문서가 아니라 텍스트 구간이라면, 여러분이 쓰고 있는 대상은 텍스트 구간입니다.

이 페이지의 내용
이 글 공유하기
X에 공유 LinkedIn에 공유
짧은 답

구절입니다. 엔진은 여러분의 페이지에서 텍스트 구간을 떼어내 다른 사이트에서 떼어낸 구간들 옆에 놓습니다. 그래서 답변의 자리를 놓고 경쟁하는 대상은 그 구간이지, 그것을 담고 있을 뿐인 문서가 아닙니다. 이 관계를 다루는 학술 연구가 문장 단위로 측정되는 이유가 바로 그것입니다. 생성형 검색 엔진 네 곳을 대상으로 한 2023년 평가는 생성된 문장 가운데 인용으로 온전히 뒷받침되는 것이 평균 51.5%에 불과하다는 것을 발견했습니다.2

핵심 요약
  • 주소를 지정할 수 있는 단위는 약 100단어짜리 구절이고, 그 자체의 내용으로 평가됩니다. 2,500단어짜리 글은 그 경쟁에서 약 스무 개의 별개 출품작이며, 그중 두세 개가 모든 일을 합니다.
  • 인용 가능성은 구간의 속성이지 페이지의 속성이 아닙니다. 주어, 한정어, 수치, 날짜가 모두 그 구간 안에 들어 있어야 합니다. 엔진이 읽을 시점에는 그 주변의 모든 것이 사라져 있기 때문입니다.
  • 출처가 답변을 얼마나 깊이 형성했는지에 대해 공개된 것 중 가장 상세한 대리 지표는 문단 커버리지와 n-gram 중첩으로 만들어져 있습니다. 즉 페이지가 아니라 구절을 측정합니다.1
  • 같은 데이터셋에서 직접적 사실 뒷받침으로 쓰인 인용의 평균 영향력은 0.1241, 배경 용도로만 쓰인 경우는 0.0775였고, 관측치는 각각 5,411건과 5,100건입니다.1
  • Google은 “chunking”을 전술로 삼지 말고 무시하라고 말합니다.6 두 가지가 동시에 성립합니다. 독자와 추출기 모두 그 자체로 완결된 단위를 필요로 하니 그렇게 쓰고, 아무도 요구하지 않은 기계용 포맷은 내놓지 마십시오.
단위

엔진은 여러분의 페이지를 인용하는가, 거기서 뽑아낸 구절을 인용하는가?

엔진은 구절을 인용하고 거기에 여러분의 URL을 붙입니다. 렌더링된 답변에서는 둘이 하나처럼 보이고, 그래서 이 구분이 사라집니다. 그러나 둘은 분리할 수 있고 각각 따로 실패합니다. 링크는 주소이고, 구절은 내용입니다. 그 구절이 혼자서도 제대로 읽히는지는 여러분의 도메인도, 권위도, 단어 수도 화면에 등장하기 전에 결정됩니다.

이 단위를 가장 분명하게 기술한 것은 2026년 7월에 공개된 업계 수집 자료입니다. 1년치 AI Mode 인용 15,699,298건이 270만 개 페이지에 걸친 460만 개의 고유한 하이라이트 구절로 귀결되었습니다. 그 데이터셋에서 인용의 47.7%는 단순 링크가 아니라 스크롤 이동 하이라이트였고, 하이라이트된 구절의 중앙값은 117단어였으며, 80%는 답을 첫 문장에 두었고, 약 85%는 완전히 그 자체로 완결되어 있었습니다. 반복해서 인용된 구절은 48%가 명시적인 질문으로 시작했고, 한 번만 인용된 구절은 22%였습니다.

이 수치들에는 단서 두 가지가 따라붙고, 둘 다 논증을 떠받치는 기둥입니다. 이 연구는 기저율을 보고하지 않으므로 “인용된 구절의 80%가 답을 먼저 놓는다”는 그럴듯한 메커니즘을 방증할 뿐 증명하지는 않습니다. 웹의 모든 문단에 대한 비율을 공개한 사람은 아무도 없습니다. 그리고 이것은 벤더 연구이므로, 이 커리큘럼은 링크를 걸지 않고 찾아낼 수 있을 만큼 정확하게 기술하는 데 그치며, 논증의 무게는 다음 절의 연구에 둡니다.

근거

구절이 단위라는 근거는 무엇인가?

독립 연구자들이 계측 도구를 어떻게 만들 수밖에 없었는지 보십시오. 통제된 프롬프트 602건, 검색 레이어 인용 21,143건, 가져온 페이지 18,151건을 다룬 2026년 프리프린트는 인용된 페이지가 실제로 답변을 얼마나 형성했는지를 재는 척도가 필요했습니다. 거기서 만들어 낸 점수는 반복 참조에 0.20, 이른 등장에 0.15, 문단 커버리지에 0.20, TF-IDF 코사인 유사도에 0.25, n-gram 중첩에 0.20의 가중치를 줍니다.1 이 다섯 구성 요소 가운데 셋은 답변의 일부와 출처의 일부를 맞대어 봅니다. 이 계측 도구는 페이지 단위로는 만들 수 없습니다. 페이지 단위에는 비교할 것이 없기 때문입니다.

같은 논문은 이 메커니즘을 그대로 인용할 만한 가설로 서술합니다. 페이지는 “재사용 가능하고 의미적으로 정렬된 정보 단위로 분해될 수 있을 때 생성형 엔진에 가치를 갖게 된다”고 하며, 정의, 통계, 비교, 단계 나열 같은 근거 장르는 “재사용 가능한 뒷받침 단위를 만들어 내는 반면 Q&A 서식은 표면의 포장일 뿐”이라고 지적합니다.1 저자들은 이 작업을 기술적이라고 부르며 확증적 분석은 뒤로 미룹니다. 따라서 이 틀은 발견이 아니라 잘 규정된 가설로 다루십시오.

독립적인 정확도 문헌도 같은 입자에서 측정함으로써 같은 방향을 가리킵니다. 2023년 검증 가능성 평가는 문장을 인용과 대조해 채점했고, 문장의 51.5%가 완전히 뒷받침되며 인용의 74.5%가 대응하는 문장을 뒷받침한다는 것을 확인했습니다.2 2026년 Google AI Overviews 감사는 답변을 98,020개의 원자적 주장으로 분해했고, 그중 11.0%가 옆에 인용된 페이지로 뒷받침되지 않는다는 것을 확인했습니다.3 그 실패들이 브랜드에 중요한지는 별개의 질문이고, 종합과 귀속이 그 답을 다룹니다. 여기서 확립되는 것은 더 좁고 더 유용합니다. 출처에서 답변으로 이어지는 연결을 진지하게 연구한 시도는 모두 페이지보다 아래에서 작업해야 했습니다.

속성

구절이 페이지에서 떼어내진 뒤에도 살아남게 하는 것은 무엇인가?

낯선 독자가 페이지를 지운 상태로 읽어도 잃는 것이 없을 때, 그 구절은 추출을 견딥니다. 그 일의 대부분을 다섯 가지 속성이 해내며, 다섯 가지 모두 구간의 바깥이 아니라 안에 무엇이 있는지에 관한 것입니다.

01

주어를 구간 안에서 명시한다

“그것”, “이 제품”, “이 접근법”은 추출기가 가져가지 않는 제목을 가리킵니다. 페이지에서는 조금 장황하게 읽히더라도 첫 문장에서 그 대상을 다시 이름으로 부르십시오.

02

한정어는 주장과 함께 움직인다

두 문단 앞에 적힌 제한은 그 구절의 일부가 아닙니다. “좌석 10석 이상 연간 플랜에서 무료”는 무료라는 단어와 같은 구간 안에 있어야 합니다. 그렇지 않으면 그 구간은 인용될 수 있으면서 틀린 것이 됩니다.

03

모든 수치는 분모와 날짜를 지니고 다닌다

표본도 수집 기간도 없는 백분율은 하류의 누구도 확인할 수 없습니다. 2026년 비판적 서베이는 기준이 수치를 더하는 것이 아니라 관련성 있고 검증 가능하며 날짜가 있고 출처가 제대로 밝혀진 근거를 제공하는 것이라고 분명히 밝힙니다.5

04

앞도 뒤도 가리키지 않는다

이웃을 가리키는 첫 문장은 이웃이 사라지기 때문에 구조적으로 인용될 수 없습니다. 금지된 첫 문장 목록이 사내에 있는 이유는 오직 이것이며, 거기서 걸린 구절은 감점되는 것이 아니라 보이지 않게 됩니다.

05

한 문단은 하나의 주장만 담는다

주장 세 개를 담은 문단은 여러분이 가장 신경 쓰지 않는 하나 때문에 선택되어 나머지 둘을 매단 채 인용될 수 있습니다. 나누면 각 주장이 저마다의 기회와 저마다의 실패 방식을 갖게 됩니다.

이 가운데 어느 것도 순위 요인이 아니다

이 속성들이 결정하는 것은 구간이 리트리벌되고 선택된 뒤에 쓸 만한지 여부입니다. 거기까지 가게 하는 데는 아무 역할도 하지 않습니다. 그것은 더 앞에서 결판나며, 크롤러 로그 읽기가 이 단계보다 앞에 오는 이유가 그것입니다.

검증

게시하기 전에 구절을 어떻게 검증하는가?

그 문단을 빈 문서에 복사해 놓고 아무 맥락 없이 읽어 보십시오. 세 가지 질문이면 결판납니다. 독자가 어디로도 스크롤하지 않고 그 문단이 무엇에 관한 것인지 말할 수 있습니까? 의미를 바꿀 만한 한정어가 눈앞의 텍스트에 모두 들어 있습니까? 그 문단이 6개월 뒤에도 참입니까, 아니면 지금 없는 날짜가 필요합니까? 셋 중 하나라도 통과하지 못하는 문단은 글이 나쁜 것이 아닙니다. 제자리에 있을 때만 작동하는 글쓰기이고, 이것은 다른 종류의 결함이며 눈에 보이지도 않습니다. 애초에 자격을 갖추지 못한 구절은 여러분의 애널리틱스가 아무것도 보고하지 않기 때문입니다.

가격 페이지와 연동 페이지에 이 검증을 돌린 어느 B2B 문서 팀은 대개 나타나는 패턴을 찾아냈습니다. 한정어들이 각 페이지 맨 위의 공용 문단으로 흘러가 있었고, 그래서 개별적으로는 정확한 열두 개 섹션이 저마다 인용될 수 있으면서 저마다 불완전했습니다. 절 하나를 각 섹션으로 되돌리는 작업은 사실을 하나도 바꾸지 않았고 페이지당 약 40단어를 더했습니다. 이런 종류의 수정은 값이 쌉니다. 그리고 팀은 이후 인용에서 생긴 어떤 변화도 이 수정에 귀속시킬 수 없었습니다. 대조군이 없는 단일 사이트로는 한 번의 수정과 같은 기간에 움직인 다른 모든 것을 갈라낼 수 없기 때문입니다.

이름을 붙일 만한 실패는 반대쪽입니다. 같은 근거를 읽은 어느 팀은 긴 가이드를 질문을 제목으로 단 서른 개 조각으로 잘랐고, 그 가이드를 인용할 만하게 만들던 이어 주는 논리를 잃었습니다. 남은 것은 다른 스무 곳에서도 구할 수 있는 정의를 저마다 되풀이하는 서른 개의 구간이었습니다. 구절 근거의 대부분을 떠받치는 논문은 그 결과를 미리 짚어 둡니다. 그 표에서 Q&A 형식은 평균 영향력이 더 낮은 쪽과 연관된 유일한 장르였고, 0.0947 대 0.1005였습니다. 저자들은 이것을 아무 일도 하지 않는 표면의 포장으로 읽습니다.1

사용 방식

어떤 구절이 배경이 아니라 사실로 쓰이는가?

같은 데이터셋은 각 인용이 답변 안에서 어떻게 쓰였는지 라벨을 붙입니다. 라벨이 붙은 인용 1만 9천 건에서 직접적 사실 뒷받침은 배경 용도만인 경우를 약 3분의 1만큼 앞섭니다.1

구절이 쓰인 방식인용 수평균 영향력직접 뒷받침 대비
직접적 사실 뒷받침5,4110.1241기준점
출처 간 종합3,9670.0964−22%
바꿔 쓰기5,3050.0955−23%
배경 용도만5,1000.0775−38%

마지막 열의 백분율은 공개된 평균값을 두고 저희가 직접 계산한 것이고, 남길 가치가 있는 것은 그 순서입니다. 확인 가능한 사실을 내놓는 구절은 사실로 쓰이고, 분위기를 내놓는 구절은 분위기로 쓰입니다. 그리고 페이지가 진술하는 대신 묘사할 때 브랜드가 다다르는 곳이 바로 그 분위기입니다. 구체적인 수치를 날짜와 분모와 함께 쓰는 것은 여기서 서식상의 요령이 아닙니다. 그것이 맨 윗줄과 맨 아랫줄의 차이 그 자체입니다.

같은 기록의 두 번째 절단면은 구절이 어떻게 쓰였는지가 아니라 무엇을 위한 것인지를 채점하며, 그 표는 무엇이 인용되나가 출처 유형 구성과 함께 다룹니다. 두 절단면은 서로 일치하지만, 이는 약한 근거이지 독립적인 근거가 아닙니다. 세 플랫폼에서의 한 수집 기간에서 나왔기 때문입니다.

귀결

이것은 페이지를 쓰는 방식에서 무엇을 바꾸는가?

페이지는 여러분이 최적화하는 대상이기를 그만두고, 여러분이 조립하는 그릇이 됩니다. 2,500단어짜리 글은 선택 단계에서 약 스무 개의 독립적인 출품작이고, 그 대부분은 어떤 것에도 자격을 얻지 못합니다. 개요를 잡는 단계에서 쓸모 있는 질문은, 실제로 인용되기를 바라는 구간이 어느 넷 또는 다섯인지, 그리고 그 각각이 누군가가 그 말 그대로 묻는 질문에 답하고 있는지입니다. 이 다시 보기는 문장보다 개요를 더 많이 바꿉니다.

이것이 허락하는 범위는 보이는 것보다 좁습니다. 선택에서 이기려고 텍스트를 일부러 다시 빚는 일은 계속 널 결과로 나오는 개입입니다. 대화형 SEO 방법 열 가지를 다룬 NeurIPS 2025 벤치마크는 54개 사례 가운데 통계적으로 유의한 순위 개선을 보인 것은 셋뿐이라고 보고했습니다.4 질문형 소제목에는 서로 독립적인 두 갈래의 뒷받침이 있습니다. 쿼리 55,393건을 다룬 연구는 Google AI Overview 발동률을 질문형 쿼리에서 64.7%, 질문형이 아닌 쿼리에서 9.5%로 측정했고3, 구절 수집 자료는 질문으로 시작하는 구간이 약 두 배 더 자주 재활용된다는 것을 발견했습니다. 이 글의 나머지는 모두 논증이 붙은 가설이며, 근거 있는 콘텐츠 레버가 그것들을 하나씩 등급 매깁니다.

이 글의 정직한 한계

Google은 2026년 7월 10일에 갱신된 자사 가이드에서 위의 모든 것을 부주의하게 읽은 해석과 어긋나는 말을 합니다. “Google 검색에 관해서는 콘텐츠 ‘chunking’, 불필요한 AI 텍스트 파일(llms.txt 같은) 만들기, 진정성 없는 언급 쫓기 같은 전술은 무시해도 됩니다.”6 이는 기계 판독용 포맷으로서의 chunking을 물리치는 것이지, 구절이 단위가 아니라고 말하는 것이 아닙니다. 같은 가이드는 쿼리 팬아웃을 설명하고, 페이지가 색인 등록되고 스니펫 노출 자격을 갖출 것을 요구합니다.7 방어 가능한 입장은 이렇습니다. 그 자체로 완결된 섹션이 독자에게도 추출기에게도 도움이 되는 것은 같은 이유에서이며, 그것을 일부러 빚는 일이 인용을 안정적으로 움직인다고 보인 공개 실험은 없습니다. 위의 구절 통계는 벤더가 공개한 것입니다. 영향력 수치는 저자들이 스스로 기술 통계라고 부르는 프리프린트 하나에서 나왔습니다. 어느 것도 인과가 아닙니다.

제품이 쓸모 있는 자리와 그렇지 않은 자리

이 글의 어떤 것도 도구를 필요로 하지 않습니다. 구절 검증에 필요한 것은 문단 하나, 빈 문서 하나, 질문 세 개이고, 다시 쓰는 일은 어느 쪽이든 여러분의 몫입니다. 여러분 페이지의 어느 네 구간이 인용될 가치가 있는지는 어떤 소프트웨어도 정해 줄 수 없습니다. Bavior는 같은 루프의 측정 쪽에서 일합니다. 고정된 프롬프트 세트를 다섯 개 엔진에 정해진 일정으로 돌리고 각 답변이 어떤 출처를 인용했는지 기록하므로, 다시 쓰기 전후 비교가 한쪽이 아니라 양쪽 모두에 숫자를 갖게 됩니다. 여러분의 초안을 읽지 않고, 구절에 점수를 매기지 않으며, 페이지를 고치지 않고, 어떤 구간이 엔진이 여러분을 인용한 이유였는지도 알려 주지 못합니다. 무료 AI 가시성 체커무료 GEO 진단은 유료 플랜 없이 이용할 수 있습니다. 유료 추적은 월간 결제 시 월 $99부터, 연간 결제 시 월 $79.17입니다(2026년 8월 30일 기준).

출처, 모두 2026년 8월 30일 확인
  1. Zhang, He, Yao, “From Citation Selection to Citation Absorption”, arXiv:2604.25707(프리프린트. 저자들은 기술 통계라고 부릅니다). 통제된 프롬프트 602건, 검색 레이어 인용 21,143건, 가져온 페이지 18,151건. 영향력 점수는 §5.2, 사용 방식은 §8.3, 근거 컨테이너 가설은 §9: arxiv.org/abs/2604.25707
  2. Liu, Zhang, Liang, “Evaluating Verifiability in Generative Search Engines”, arXiv:2304.09848. “생성된 문장 가운데 인용으로 온전히 뒷받침되는 것은 51.5%에 불과하고, 대응하는 문장을 뒷받침하는 인용은 74.5%에 그친다”: arxiv.org/abs/2304.09848
  3. Xu, Iqbal, Montgomery, 2026(프리프린트). 2026년 3월 13일부터 4월 21일까지 수집한 트렌드 쿼리 55,393건. 원자적 주장 98,020건 가운데 11.0%가 뒷받침되지 않음. AI Overview 발동률은 질문형 쿼리에서 64.7%, 그 외에서 9.5%: arxiv.org/abs/2605.14021
  4. Puerto, Gubri, Green, Oh, Yun, “C-SEO Bench: Does Conversational SEO Work?”, NeurIPS 2025 Datasets & Benchmarks Track, arXiv:2506.11097. 열 가지 방법, 1.9k건이 넘는 쿼리와 16k건의 문서. §6.2: “54개 사례 가운데 순위 개선이 통계적으로 유의한 경우는 셋뿐이었다”: arxiv.org/abs/2506.11097
  5. “Optimizing Visibility in Generative Engines: A Critical Survey”, 2026년 7월 15일, arXiv:2607.14035(서베이 프리프린트): arxiv.org/abs/2607.14035
  6. Google Search Central, “Google’s Guide to Optimizing for Generative AI Features on Google Search”, 최종 갱신 2026년 7월 10일(1차 자료. chunking 요약 대목): developers.google.com/search/docs/fundamentals/ai-optimization-guide
  7. Google Search Central, “AI features and your website”, 최종 갱신 2025년 12월 10일(1차 자료. 쿼리 팬아웃과 색인 등록 및 스니펫 노출 자격 요건): developers.google.com/search/docs/appearance/ai-features
  8. 업계의 구절 단위 수집 자료, 2026년 7월. 1년치 AI Mode 인용 15,699,298건이 270만 개 페이지에 걸친 460만 개의 고유한 하이라이트 구절로 귀결. 구절 중앙값 117단어. 벤더가 공개한 자료여서 링크 없이 설명만 합니다.
FAQ

자주 묻는 질문입니다.

AI 엔진은 인용하기 전에 제 페이지 전체를 읽습니까?

파이프라인의 어딘가는 여러분의 페이지를 가지고 있지만, 답변까지 닿는 것은 거기서 떼어낸 텍스트 구간입니다. 출처가 답변을 얼마나 형성했는지에 대해 공개된 것 중 가장 상세한 대리 지표는 문단 커버리지, TF-IDF 코사인 유사도, n-gram 중첩으로 만들어져 있고, 셋 다 답변의 일부와 출처의 일부를 맞대어 봅니다. 어느 한 섹션을 떼어내도 여전히 정확하도록 쓰십시오. 평가받는 대상이 바로 그것이기 때문입니다.

인용될 만한 구절은 얼마나 길어야 합니까?

공개된 유일한 구절 단위 수집 자료는 하이라이트된 구절의 중앙값을 117단어로 보고합니다. 다만 이는 엔진이 우연히 가져간 것에 대한 기술이지, 그것에 맞춰 쓰라는 목표가 아닙니다. 상식 점검으로 쓰십시오. 600단어에 이르는 섹션은 각각 자기 제목을 갖는 편이 나은 주장을 여러 개 담고 있을 가능성이 높고, 30단어짜리 섹션은 자기 주어와 한정어와 날짜를 감당하지 못할 가능성이 높습니다.

인용되려고 페이지를 FAQ 형식으로 바꿔야 합니까?

아닙니다. 그리고 근거는 오히려 반대쪽을 약하게 가리킵니다. 2026년 인용 흡수 데이터셋에서 Q&A 페이지 형식은 평균 영향력이 약간 낮은 쪽과 연관되었고, 0.0947 대 0.1005였습니다. 저자들은 이를 추출 가능한 근거의 공급원이 아니라 표면의 포장으로 읽습니다. 질문형 소제목은 뒷받침이 충분하며 그것과는 다른 개입입니다. 소제목에서 진짜 질문을 던지고, 그 답을 평범하고 그 자체로 완결된 섹션의 첫 문장에서 주십시오.

구절이 단위라면, Google은 chunking을 무시하라고 말하지 않았습니까?

그렇게 말했습니다. 그리고 두 진술은 동시에 성립합니다. 2026년 7월 10일에 갱신된 Google 가이드는 무시해도 되는 전술 목록에 chunking을 올려 두었고, 그것은 기계 판독용 포맷을 물리치는 것이지 생성된 답변에 무엇이 담기는지를 기술하는 것이 아닙니다. 같은 가이드는 쿼리 팬아웃을 설명하고, 페이지가 색인 등록되고 스니펫 노출 자격을 갖출 것을 요구합니다. 그 자체로 완결된 섹션을 쓰는 이유는 독자와 추출기가 같은 것을 필요로 하기 때문이지, 엔진이 어떤 포맷을 요구했기 때문이 아닙니다.

Bavior 편집팀

Reddit 마케팅과 AI 검색 가시성에 관한 Bavior의 콘텐츠를 조사하고 관리하는 팀입니다. 본문의 모든 수치에는 출처와 확인 날짜를 명시했으며, 제휴 링크는 사용하지 않습니다.

수치에 오류를 발견하셨나요? 알려주시면 다시 확인하겠습니다: support@bavior.com

엔진이 인용하는 것은 구절이지,
페이지가 아닙니다. 구절을 쓰십시오.

무료 체험 시작