AI 엔진들은 누구를 인용할지에 대해 일치할까요? 학술 감사 세 건의 답은 “대체로 아니다”입니다.
같은 질문을 두 어시스턴트에게 던지면 돌아오는 출처는 크게 다릅니다. 한 회사가 같은 색인 위에 만든 두 서피스도 마찬가지입니다. 이 사실 하나가 AI 가시성을 어떻게 측정하고 어떻게 보고해야 하는지를 결정합니다.
이 페이지 내용
AI 엔진들은 어떤 출처를 인용할지에서 대체로 일치하지 않습니다. 그래서 한 엔진에서의 인용은 다른 어떤 엔진에 대해서도 약한 근거입니다. 가장 선명한 측정은 한 회사가 하나의 색인 위에 만든 세 서피스에서 나옵니다. SIGIR 2026에서 발표된 쿼리 11,500건 연구는 Google 오가닉 결과와 AI Overviews와 Gemini 사이의 URL 수준 평균 Jaccard 유사도가 0.2 미만이라고 보고합니다.1
핵심 요약- Jaccard는 교집합을 합집합으로 나눈 값이지 인용된 URL의 비중이 아닙니다. 0.18이면 두 서피스 중 어느 한쪽이라도 반환한 출처 가운데 양쪽 모두가 반환한 것은 18%뿐입니다.
- 갈라짐은 콘텐츠 품질이 평가되기 전에 시작됩니다. 엔진마다 다른 토큰으로 크롤링하고, 질문을 서로 다른 하위 쿼리로 펼치며, 인용하는 출처의 수와 종류도 다릅니다.
- 하나로 섞은 AI 가시성 점수는 행동으로 옮길 수 있는 유일한 정보를 가립니다. 엔진별, 서피스별로 한 행씩 날짜와 로케일을 붙여 보고하고, 행을 가로지르는 계산은 하지 마십시오.
두 AI 엔진은 실제로 얼마나 겹치나
두 AI 엔진의 겹침은 대부분의 사람이 생각하는 것보다 훨씬 작습니다. 한 회사가 하나의 색인 위에 만든 두 서피스도 URL 수준 Jaccard가 0.11에서 0.18에 그치고, 서로 무관한 두 어시스턴트는 이를 측정한 유일한 감사에서 도메인의 26%만 공유했습니다.
독립적인 학술 측정 네 건이고, 방법도 분모도 수집 기간도 저마다 다릅니다. 숫자보다 마지막 두 열을 먼저 읽으십시오.
| 연구 | 표본과 수집 기간 | 결과 | 무엇을 측정하나 |
|---|---|---|---|
| Grossman 외, SIGIR 2026 | 쿼리 11,500건 | URL Jaccard 0.11–0.18 | Google 오가닉 결과, AI Overviews, Gemini 사이의 집합 겹침 |
| Kirsten 외, Findings of ACL 2026 | 쿼리 4,706건, 2025년 9월 수집 | 53%가 오가닉 상위 10위에 없음, 27%가 상위 100위에 없음 | AI Overviews가 참조하는 도메인 단위로 같은 쿼리의 오가닉 결과와 대조 |
| Xu, Iqbal, Montgomery, 2026 프리프린트 | 쿼리 55,393건, 2026년 3월 13일부터 4월 21일까지 수집 | 29.8%가 오가닉 첫 페이지에 없음 | AI Overview가 참고로 든 도메인 단위로 같은 쿼리의 첫 페이지와 대조 |
| Li, Sinnamon, 2024 | 답변 672건, 고유 도메인 355개 | 26%가 양쪽 모두에서 인용 | 두 어시스턴트 사이의 도메인 겹침 |
Jaccard 0.15는 실제로 무슨 뜻인가
Jaccard 유사도는 교집합의 크기를 합집합의 크기로 나눈 값입니다. 인용된 URL의 비중이 아닌데도, 마치 그런 것처럼 반복해서 옮겨집니다. 어떤 쿼리에서 AI Overviews가 URL 열 개를 인용하고 Gemini도 열 개를 인용했다면, 겹침 0.15는 대략 세 개의 URL이 양쪽 목록에 모두 나오고 둘을 합쳐 서로 다른 URL이 약 열일곱 개 존재한다는 뜻입니다. Grossman 등은 가장 많이 겹치는 쌍을 자기들의 말로 이렇게 적었습니다. “평균적으로, AIO 또는 전통적 SERP 중 어느 쪽이든 반환한 출처 가운데 두 검색 엔진 모두가 리트리벌하는 것은 18%에 불과하다.”1
세 쌍이 똑같이 나쁜 것은 아니지만, 초록은 그 사실을 알려 주지 않습니다. 초록이 보고하는 것은 “평균 Jaccard 유사도 <0.2”뿐이고, 쌍별 값은 표 2에 있습니다. AI Overviews 대 오가닉 결과가 0.18, 오가닉 결과 대 Gemini가 0.16, AI Overviews 대 Gemini가 0.11입니다.1 대부분의 사람이 서로 바꿔 써도 된다고 여기는 쌍, 곧 두 생성형 서피스가 가장 적게 일치하는 쌍입니다.
반복 측정도 그림을 구해 주지 않습니다. 비판적 서베이는 Schulte 등을 이렇게 요약합니다. 네 개 엔진을 45일간 관찰한 일별 출처 수준 Jaccard가 대략 0.34에서 0.42였고, 24시간 이내의 반복에서도 비슷한 수준이었으며, 서베이는 이 산포를 근거로 프롬프트당 일곱에서 여덟 번의 반복을 주장합니다.11 숫자와 함께 단서도 읽으십시오. 서베이는 이것이 작은 스위스 쿼리 집합에서 나왔다고 밝힙니다. 그럼에도 발표된 것 중 가장 좁은 비교조차 2분의 1에 이르지 못합니다.
같은 웹을 읽는 엔진들이 왜 이렇게 어긋나나
엔진들이 어긋나는 것은 콘텐츠 품질이 고려되기도 전에 네 가지가 다르기 때문입니다. 어떻게 크롤링하는지, 질문을 어떻게 펼치는지, 출처를 몇 개 인용하는지, 어떤 종류를 선호하는지입니다.
이 네 가지 차이는 겹쳐 쌓이고, 어느 것도 모든 엔진에 대해 한 번에 고칠 수 없습니다.
같은 웹을 읽지 않습니다
엔진마다 자기 토큰으로 크롤링하고, 벤더마다 그 토큰을 따로 문서화합니다. OpenAI는 GPTBot과 OAI-SearchBot을 나누고, Anthropic은 ClaudeBot과 Claude-SearchBot을 나누며, Google은 Google-Extended와 Googlebot을 나눕니다.5 하나를 막는 robots.txt 규칙은 나머지를 건드리지 않으므로, 순위 매기기가 시작되기도 전에 후보 풀이 이미 다릅니다.
질문을 펼치는 방식이 다릅니다
Google은 AI Overviews와 AI Mode가 쿼리 팬아웃 기법을 써서 하위 주제와 데이터 소스를 가로질러 여러 관련 검색을 발행해 답변을 만들 수 있다고 문서화합니다.6 하위 쿼리는 엔진마다 따로 생성되므로, 어느 쪽이 순위를 매기기도 전에 두 엔진은 서로 다른 질문에 대해 리트리벌합니다.
인용 예산이 다릅니다
통제된 프롬프트 602건에서 답변당 평균 인용 수는 ChatGPT가 6.88, Google의 AI 서피스가 12.06, Perplexity가 16.35였습니다.7 출처를 16개 인용하는 엔진은 7개를 인용하는 엔진보다 후보 목록을 더 아래까지 훑으므로, 경계에 있는 출처는 구조상 달라집니다.
선호하는 출처의 종류가 다릅니다
같은 데이터셋에서 논문이 공식이라고 분류한 출처는 ChatGPT 인용의 34.22%, Google의 46.35%였고, 뉴스는 ChatGPT가 31.17%, Google이 18.99%였습니다.7 한 엔진에 맞는 종류의 페이지가 다른 엔진에는 맞지 않는 종류입니다.
이 네 가지 차이는 서로 상쇄되지 않고 곱해집니다. 관측되는 겹침이 그토록 낮은 이유가 여기 있습니다. 많은 팀이 수수께끼로 읽는 양상도 이것으로 설명됩니다. 어떤 페이지는 한 엔진에서는 끊임없이 인용되는데 다른 엔진에는 한 번도 나오지 않고, 그 페이지 자체에는 아무 문제가 없습니다. 콘텐츠를 진단하기 전에, 여러분을 무시하는 그 엔진이 애초에 여러분을 페치할 수 있는지 확인하십시오. 그것은 테크니컬 GEO의 주제이며, 더 나은 답을 쓰는 일과는 다른 조사입니다.
Google 순위는 여전히 인용을 예측하나
순위는 여전히 인용되는 것의 가장 강한 단일 예측 변수이고, 이제 그것만으로는 충분하지 않습니다. 이를 하나의 겹침 백분율로 표현할 수는 없습니다. 발표된 수치들이 서로 다른 두 질문에 답하기 때문입니다. “AI 답변 가운데 순위도 가진 페이지를 적어도 하나 포함하는 비율은 얼마인가”와 “개별 인용 가운데 순위도 가진 페이지에서 온 비율은 얼마인가”는 동일한 데이터에서 완전히 다른 답을 냅니다. 2025년 10월 미국 쿼리 362,000건을 다룬 상업 연구는 둘 다 보고했습니다. AI Overviews의 94%가 오가닉 상위 20위 URL을 적어도 하나 포함했고, 개별 인용의 56%가 상위 20위에서 왔습니다.8 같은 데이터, 두 숫자, 둘 다 맞고, 38포인트 차이입니다.
학술 수치들도 분모를 읽고 나면 같은 자리에 놓이고, 둘을 합치면 점이 아니라 날짜 두 개가 붙은 구간이 됩니다. Kirsten 등의 쿼리 4,706건 감사는 2025년 9월 미국과 독일에서 수집되었고, 참조하는 도메인 단위로 셉니다. “평균적으로 AIO가 참조하는 도메인의 53%(27%)는 오가닉 검색 결과 상위 10위(상위 100위)에 포함되지 않는다.”2 Xu, Iqbal, Montgomery는 2026년 3월 13일부터 4월 21일까지 트렌드 쿼리 55,393건을 수집해, AI Overview가 참고로 든 도메인의 29.8%가 대응하는 첫 페이지 어디에도 나오지 않는다고 보고합니다.10 이것은 대략 30%에서 53%라는 구간으로, 두 수집 기간을 함께 밝혀 인용하십시오. 그리고 동사를 구분해 두십시오. Kirsten이 재는 것은 시스템이 참조하는 도메인이고, 이는 시스템이 인용하는 도메인과 같지 않습니다. 또 둘 중 어느 쪽도 AI Overview가 대개 순위 있는 페이지를 포함하는지는 말하지 않습니다. 대개는 포함합니다.
수치는 빠르게 움직입니다. 한 제공사는 인용 단위 겹침을 2025년 9월에는 54.5%로, 2026년 2월에는 약 17%로 발표했습니다. 같은 도구, 같은 아홉 개 산업인데 그 격차에 대한 설명은 없습니다.9 여섯 달쯤보다 오래된 겹침 수치는 만료된 것으로, 날짜가 없는 수치는 허구로 다루십시오.
여기 나온 모든 겹침 수치는 움직이는 시스템의 스냅숏이고, 창업자가 신경 쓰는 엔진 전부를 다룬 학술 연구는 없습니다. SIGIR 연구는 Google의 세 서피스를 비교하고, ACL 감사는 Google만 다루며, 두 어시스턴트 감사가 측정한 것은 2024년 당시의 Bing Chat과 Perplexity입니다. ChatGPT, Perplexity, Google, Copilot, Claude를 하나의 방법으로 하나의 기간에 측정한 사람은 아직 없습니다. 그래서 엔진들이 크게 어긋난다는 일반적 주장은 잘 뒷받침되지만, 특정 쌍의 수치는 여러분의 프롬프트 집합으로 옮겨 오지 못합니다. 이 수치들을 가져다 쓰지 말고 여러분 자신의 집합을 측정하십시오.
하나로 섞은 AI 가시성 점수가 왜 무의미한가
엔진을 가로질러 평균을 내면 결정에 필요한 정보가 바로 파괴됩니다. 느슨하게만 상관하는 두 계열의 평균은 어느 쪽의 요약도 아니기 때문입니다. 한 엔진에서는 실행의 40%에서 인용되고 다른 엔진에서는 0%인 브랜드는 양쪽에서 20%인 브랜드와 섞은 점수가 같지만, 두 상황은 정반대의 작업을 요구합니다. 앞은 한 엔진에서의 접근 문제이고, 뒤는 어디서나 약하지만 넓게 걸쳐 있는 위치입니다.
가중치를 주면 나아지기는커녕 나빠집니다. 인용은 엔진을 가로질러 같은 한 단위가 아니기 때문입니다. 프롬프트 602건 데이터셋에서 인용된 페이지당 평균 영향력은 ChatGPT가 0.2713, Google이 0.0584, Perplexity가 0.0646으로, 인용 하나가 답변을 얼마나 빚어내는지가 대략 네 배 차이입니다.7 ChatGPT 인용에 Perplexity 인용을 더하는 것은 서로 다른 두 단위를 더하는 일이고, 어떤 단일 스칼라도 그것을 고치지 못합니다.
섞은 숫자에는 좁은 쓸모가 하나 있습니다. 전체 그림이 움직이는지만 보는 분기 대 분기의 거친 추세선입니다. 우선순위 결정도, 경쟁사 비교도, 특정 변경이 효과가 있었는지에 대한 판정도 떠받치지 못하는데, 대부분의 사람이 그것을 집어 드는 이유가 바로 그 셋입니다.
그러면 AI 가시성을 어떻게 보고해야 하나
엔진별, 서피스별로 한 행씩. 행을 가로지르는 계산은 없습니다. 스프레드시트에서 돌아갑니다.
엔진과 서피스를 모든 숫자에 넣으십시오
“AI 가시성 18%”가 아니라 “Google AI Mode, en-US, 2026년 8월, 40회 실행 중 7회 인용”입니다. AI Overviews와 AI Mode는 서로 다른 서피스이므로 행을 나눠야 합니다. 한 회사가 스스로 만든 서피스들끼리도 겹침이 Jaccard 0.11–0.18이기 때문입니다.
자기 노출만이 아니라 인용된 URL을 추적하십시오
각 엔진이 계속 인용하는 출처의 집합은 그곳에서 여러분이 겨루는 상대의 지도이고, 엔진마다 다릅니다. 대부분의 상업적 질문에서 그 목록의 대부분은 남의 것입니다.
수정은 고르지 않게 도달한다고 예상하고 미리 말하십시오
한 엔진에서 인용률을 올린 변경이 다른 엔진에서는 몇 달 동안, 혹은 끝내 아무 일도 일으키지 않을 수 있습니다. 출시 전에 엔진별 목표를 정해 두면 그것이 실패로 읽히지 않습니다.
구매자가 쓰는 한두 엔진을 고르십시오
갈라짐이 있다는 것은 다섯 엔진을 똑같이 덮으려면 같은 확신을 얻는 데 다섯 배가 든다는 뜻입니다. 둘을 제대로 표집하는 편이 다섯을 엉성하게 표집하는 것보다 낫고, 무엇을 고를지는 이미 트래픽이 어디서 오는지를 따라야 합니다.
위의 보고 규율이 방법의 전부이고, 소프트웨어는 필요 없습니다. AI 검색의 작동 방식 단계는 이 갈라짐을 설명하는 파이프라인 단계들을 제공합니다. AI 가시성 측정 단계는 엔진별 행을 완전한 측정 계획으로 바꿉니다. 자매 글인 AI 답변이 달라지는 이유는 각 행 안에 있는 실행 간 분산을 다룹니다.
위의 엔진별 표는 손으로도 돌릴 수 있습니다. 고정된 프롬프트, 엔진마다 탭 하나, 실행 횟수와 인용된 URL 집계, 평균 없음. Bavior는 그 잡일을 자동화합니다. 정해진 프롬프트 묶음을 다섯 개 엔진에 정기적으로 돌리고, 각 답변이 어떤 출처를 인용했는지 섞지 않고 엔진별로 기록합니다. 단일 가시성 점수를 만들지 않고, 두 엔진이 왜 여러분에 대해 어긋나는지 알려 주지 못하며, 구매자가 어떤 엔진을 쓰는지에도 영향을 주지 못합니다. 무료 AI 가시성 체커와 무료 GEO 진단은 유료 플랜 없이 이용할 수 있습니다. 유료 추적은 월간 결제 시 월 $99부터, 연간 결제 시 월 $79.17입니다(2026년 8월 29일 기준).
- Grossman 외, “How Generative AI Disrupts Search”, SIGIR 2026, 쿼리 11,500건. 초록은 “평균 Jaccard 유사도 <0.2”, 표 2에 쌍별 0.18, 0.16, 0.11: arxiv.org/abs/2604.27790
- Kirsten 외, Findings of ACL 2026, Google AI Overviews에 대한 쿼리 4,706건 감사, 데이터는 2025년 9월 미국과 독일에서 수집. “on average 53% (27%) of domains that AIO consults are not contained in top-10 (top-100) Organic search results”: aclanthology.org/2026.findings-acl.526
- Li, Sinnamon, “Generative AI Search Engines as Arbiters of Public Knowledge”, Proceedings of ASIST 61(1), 2024. Bing Chat과 Perplexity에 걸친 답변 672건, 고유 도메인 355개, 26%가 양쪽 모두에서 인용: arxiv.org/abs/2405.14034
- “Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)”, 2026년 7월 15일, arXiv:2607.14035(서베이 프리프린트): arxiv.org/abs/2607.14035
- 학습용 토큰과 검색용 토큰 분리에 관한 1차 크롤러 문서: OpenAI developers.openai.com/api/docs/bots, Anthropic support.claude.com/en/articles/8896518, Perplexity docs.perplexity.ai/guides/bots
- Google Search Central, “AI features and your website”(쿼리 팬아웃, 1차 문서, 최종 업데이트 2025년 12월 10일): developers.google.com/search/docs/appearance/ai-features
- Zhang, He, Yao, “From Citation Selection to Citation Absorption: A Measurement Framework for GEO Across AI Search Platforms”, 2026년 4월 28일, arXiv:2604.25707(프리프린트, 프롬프트 602건 공개 데이터셋): arxiv.org/abs/2604.25707
- 2025년 10월 미국 데스크톱 쿼리 362,000건 연구. AI Overviews의 94%가 오가닉 상위 20위 URL을 포함한다는 것과 개별 인용의 56%가 상위 20위에서 온다는 것을 함께 보고. 벤더 발표이며, 이 커리큘럼의 출처 규칙에 따라 설명만 하고 링크하지 않습니다.
- 인용 단위 오가닉 겹침 수치 54.5%(2025년 9월)와 약 17%(2026년 2월). 한 제공사의 같은 도구, 같은 아홉 개 산업에서 나왔고 서로 조정되지 않았습니다. 벤더 발표이며, 이 커리큘럼의 출처 규칙에 따라 설명만 하고 링크하지 않습니다.
- Xu, Iqbal, Montgomery, 2026, 2026년 3월 13일부터 4월 21일까지 수집한 트렌드 쿼리 55,393건. “29.8% of AIO reference domains do not appear anywhere on the corresponding first page”(프리프린트): arxiv.org/abs/2605.14021
- Schulte 외, 2026, 네 개 엔진을 45일간 관찰한 일별 출처 수준 Jaccard 대략 0.34에서 0.42, 작은 스위스 쿼리 집합. 출처 4의 비판적 서베이에 요약된 대로 인용.
자주 묻는 질문입니다.
ChatGPT가 저를 인용하면 Perplexity도 인용할까요?
지금 있는 근거로는 대개 그렇지 않습니다. Bing Chat과 Perplexity에 걸친 답변 672건 감사는 인용된 고유 도메인 355개를 찾았고, 그중 양쪽 모두에 나온 것은 26%뿐이었습니다. 한 회사가 하나의 색인 위에 만든 두 서피스조차, SIGIR 2026에서 발표된 쿼리 11,500건 연구에 따르면 URL 수준 Jaccard가 0.11에서 0.18입니다. 한 엔진에서의 인용은 그 엔진에 대한 근거로만 다루고, 나머지가 따라온다고 가정하지 말고 따로 확인하십시오.
AI 인용과 오가닉 상위 10위의 실제 겹침은 얼마인가요?
하나의 정답은 없습니다. 발표된 수치들이 서로 다른 두 질문에 답하기 때문입니다. AI 답변 단위로 재면, 곧 이 답변이 순위도 가진 페이지를 적어도 하나 포함하는지 물으면, 쿼리 362,000건 상업 연구에서 AI Overviews의 94%가 상위 20위 URL을 포함했습니다. 인용 단위로 재면, 곧 인용된 페이지 가운데 순위도 가진 비율을 물으면, 같은 표본에서 상위 20위에서 온 것은 56%였고, 쿼리 4,706건 학술 감사는 2025년 9월 데이터에서 AI Overviews가 참조하는 도메인의 53%가 오가닉 상위 10위에 없다는 것을 찾았습니다. 2026년 3월과 4월에 수집된 쿼리 55,393건 프리프린트는 비교 가능한 첫 페이지 기준으로 29.8%를 측정했으니, 점이 아니라 구간으로 인용하십시오. 어떤 수치든 옮기기 전에 어떤 분모와 어떤 수집 기간을 쓰는지부터 물으십시오.
AI 엔진 하나에만 최적화해야 하나요, 아니면 전부 해야 하나요?
구매자가 실제로 쓰는 한두 개를 고르십시오. 갈라짐 때문에 넓게 덮는 것은 철저해지는 대신 비싸지기 때문입니다. 다섯 엔진을 같은 확신까지 덮으려면 표집이 대략 다섯 배 필요하고, 한 서피스에서 통한 수정이 다른 서피스에서는 아무 일도 하지 않는 경우가 잦습니다. 한 회사가 스스로 가진 오가닉, AI Overviews, Gemini 서피스끼리도 겹침이 Jaccard 0.11에서 0.18입니다. 예외는 기술적 검색 가능성이며, 이것은 모든 엔진에 한꺼번에 값을 하는 유일한 층입니다. 색인될 수 있고, 빠르고, 서버에서 렌더링되는 것은 어디서나 도움이 되기 때문입니다.
하나로 섞은 AI 가시성 점수가 쓸모 있을 때가 있나요?
분기 대 분기의 거친 추세선으로만 쓸모가 있고, 결정에는 결코 쓸 수 없습니다. 한 엔진에서는 실행의 40%에서 인용되고 다른 엔진에서는 0%인 브랜드는 양쪽에서 20%인 브랜드와 섞은 점수가 같지만, 두 상황이 필요로 하는 작업은 정반대입니다. 가중치도 구해 주지 못합니다. 프롬프트 602건 학술 데이터셋에서 인용된 페이지당 평균 영향력은 ChatGPT가 0.2713, Google이 0.0584, Perplexity가 0.0646이었습니다. 그러니 서로 다른 엔진의 인용은 같은 단위가 아닙니다.
엔진이 왜 Google에서는 저를 인용하는데 ChatGPT에서는 한 번도 인용하지 않나요?
가장 흔한 이유는 순위를 매기기 전에 두 엔진이 같은 버전의 웹을 읽고 있지 않다는 것입니다. 벤더마다 크롤러 토큰을 따로 문서화하는데, OpenAI는 GPTBot과 OAI-SearchBot을, Anthropic은 ClaudeBot과 Claude-SearchBot을, Google은 Google-Extended와 Googlebot을 나눕니다. 그래서 robots.txt 규칙 하나, WAF 규칙 하나, 렌더링 요구 사항 하나가 여러분을 한 엔진의 후보 풀에서 지우면서 다른 엔진은 그대로 둘 수 있습니다. 페이지를 다시 쓰기 전에 엔진별로 페치할 수 있는지 확인하십시오.
Reddit 마케팅과 AI 검색 가시성에 관한 Bavior의 콘텐츠를 조사하고 관리하는 팀입니다. 본문의 모든 수치에는 출처와 확인 날짜를 명시했으며, 제휴 링크는 사용하지 않습니다.
수치에 오류를 발견하셨나요? 알려주시면 다시 확인하겠습니다: support@bavior.com