/GEO 배우기/진단법
AI 검색의 작동 방식 · 진단법

왜 이렇게 많은 GEO 조언이 틀리는가?

네 가지 질문이면 이 분야의 거의 모든 주장이 “뒷받침된다”, “가장 어려운 부분을 건너뛴 곳에서 측정되었다”, “메커니즘이 없다”의 셋으로 갈립니다. 그 네 가지를, 그것을 만들어 낸 결과들과 함께 아래에 싣습니다.

이 페이지 내용
이 글 공유하기
X에 공유 LinkedIn에 공유
짧은 답

대부분의 GEO 조언이 틀리는 이유는, 그것이 파이프라인의 마지막 단계에 작용하는 데다 앞의 네 단계를 꺼 놓은 환경에서 측정되었기 때문입니다. 어떤 주장이든 그것이 어느 단계에 작용하는지, 그리고 누군가 측정할 때 리트리벌이 돌고 있었는지를 물으면 분류됩니다. 문서 171,003건에 리트리벌과 재순위화를 되돌려 놓은 KDD 2026 벤치마크는, 본문만 최적화하면 평균 상위 20위 노출률이 9%, 최종 인용률이 6% 떨어진다고 측정했습니다.1

핵심 요약
  • 그 전술이 다섯 개 파이프라인 단계 중 어디에 작용하는지 물으십시오. 해석과 팬아웃은 여러분의 사이트에서 입력을 전혀 받지 않으므로, 그곳을 겨냥한 전술에는 지나갈 메커니즘이 없습니다.
  • 그 효과를 측정할 때 리트리벌과 재순위화가 돌고 있었는지 물으십시오. 문서를 먼저 모델의 컨텍스트에 넣는 연구는 그 페이지가 리트리벌되었을지를 말해 주지 못합니다.
  • 그 전술이 누구를 위한 것인지 물으십시오. 최초 논문 자신의 표에서, 가장 강한 세 가지 재작성은 이미 1위였던 출처의 가시성을 20%에서 30%까지 깎았고, 5위였던 출처는 대략 두 배로 만들었습니다.2
근본 원인

왜 이렇게 많은 GEO 조언이 틀리는가?

손대기 가장 쉬운 단계가 따로 떼어 측정하기도 가장 쉬운 단계이고, 이 두 사실이 겹쳐 하나의 산업이 되었기 때문입니다. 페이지 재작성은 인프라를 건드리지 않고 한 사람이 오후 한나절이면 끝냅니다. 그래서 조언이 그곳에 몰렸습니다. 재작성 측정도 고정된 문서 묶음을 모델에 건네고 표현만 바꾸면 쉽습니다. 그래서 초기 실험도 그곳에 몰렸습니다. 그 결과, 이미 모델의 컨텍스트 안에 있는 문서에 무슨 일이 일어나는가에 관한 진짜 발견의 더미가, 열린 웹의 페이지에 무슨 일이 일어나는가에 관한 주장으로 일반화되었습니다.

2026년 비판적 서베이는 자신의 확신도 표에 그 선을 그어 둡니다. 이미 컨텍스트에 놓인 문서가 자기 순위, 인용, 사용을 인과적으로 바꿀 수 있다는 것은 높음 확신도로 평가되며, 이 근거가 “오가닉 리트리벌을 다루지 않는다”는 주석이 붙습니다. 화이트햇 개입이 여러 엔진에 걸쳐 오가닉 발견 가능성을 지속적으로 개선한다는 것은 낮음으로 평가됩니다. 인용 점수가 클릭, 전환, 매출을 예측한다는 것은 매우 낮음으로 평가됩니다.3 이 분야의 실망은 거의 전부 첫 행과 나머지 두 행 사이의 틈에 삽니다. AI 검색의 작동 방식 단계가 이 진단법이 상대로 삼아 분류하는 파이프라인입니다.

진단법

GEO 주장을 그것이 작용하는 단계로 어떻게 분류하나?

GEO 주장은 다섯 개 파이프라인 단계 중 어디에 작용하는지, 그 단계에서 여러분이 가진 것이 입력이 되는지, 그 효과에 어떤 근거가 있는지, 그리고 효과 크기가 얼마인지를 물어서 분류합니다.

이 넷을 순서대로 물으십시오. 대부분의 주장은 첫째나 둘째에서 멈춥니다.

01

어느 단계에 작용합니까?

정직한 답이 해석이나 팬아웃이라면 메커니즘이 없습니다. 그 단계들은 어떤 문서에도 닿기 전에 끝나고, 여러분의 사이트에서 입력을 받지 않기 때문입니다. 답이 리트리벌이라면 근거가 가장 강합니다. 종합이라면 근거가 가장 약하고, 그 전술은 상류에서 여러분에게 손해를 입힐 수 있습니다.

02

측정할 때 앞 단계들이 돌고 있었습니까?

그 연구가 문서를 모델의 컨텍스트에 넣어 두고 표현만 바꿨다면, 결과는 진짜이지만 그 페이지가 리트리벌되었을지는 말해 주지 못합니다. 그 설계 선택 하나가 이 분야의 낙관적 결과와 비관적 결과를 갈라놓습니다.

03

분모는 무엇이고, 날짜는 언제입니까?

이 분야에서 백분율은 이 둘이 없으면 읽을 수 없습니다. 같은 데이터에서도 답변당 비중과 인용당 비중은 수십 포인트 차이가 나고, 이 시스템들은 달마다 바뀝니다. 2025년에 어느 대형 포럼에 대한 한 엔진의 인용률은 한 달 안에 약 50포인트 움직였습니다.

04

모두가 하게 되어도 여전히 통합니까?

NeurIPS 2025 벤치마크는 채택이 늘수록 이득이 줄어드는 것을 발견하고, 이 문제를 “혼잡하고 제로섬”이라고 표현합니다.4 하는 사람이 적어서 통하는 것에는 유통기한이 있고, 지금 읽고 있는 조언 자체가 그 기한을 앞당깁니다.

역전

엔드투엔드 벤치마크는 실제로 무엇을 보여 주었나?

엔드투엔드 벤치마크가 보여 준 것은, 문서가 컨텍스트에 들어간 뒤에는 이기는 바로 그 재작성이 그 문서에서 컨텍스트 자리를 빼앗을 수 있다는 사실입니다. KDD 2026 벤치마크 논문은 문서 171,003건과 쿼리 2,700건으로 환경을 만들고, 앞선 벤치마크들처럼 후보 집합을 미리 고정하는 대신 리트리벌과 재순위화를 되돌려 놓은 뒤, 본문만 최적화하면 평균 상위 20위 노출률이 약 9%, 재순위화 후 상위 10위 노출률이 16%, 최종 인용률이 약 6% 떨어진다고 측정했습니다. 자동 최적화기를 본문에만 적용하면 손실은 더 컸습니다.1

2026년 비판적 서베이의 독법은 어느 한쪽을 고르는 대신 KDD 2024 결과와의 겉보기 모순을 풀어냅니다. 재작성은 “따라서 일단 주입되고 나면 좋은 성적을 낼 수 있지만, 그러면서 그 문서를 상류에서 덜 검색 가능하게 하거나 덜 경쟁력 있게 만든다”는 것입니다.3 두 묶음의 숫자 모두 서로 다른 것을 정직하게 측정한 값이고, 여러분이 실제로 겪는 것은 그 합성입니다.

이것이 보여 주지 않는 것도 정확히 짚어야 합니다. 이것은 KDD 2026에 채택된, 한 팀이 만든 단일 벤치마크입니다. 테스트한 것은 본문만 최적화이지 가능한 모든 개입이 아닙니다. 그리고 통제된 코퍼스는 살아 있는 웹이 아닙니다. 여기서 확립되는 것은 더 좁지만 그래도 결정적입니다. 리트리벌 이후에만 평가된 콘텐츠 전술은 평가되지 않은 것이고, 적어도 한 번, 누군가 확인했을 때 총합은 음수로 나왔습니다.

1위 페널티

이미 1위라면 GEO 전술이 나에게 해가 됩니까?

그렇습니다. KDD 2024 결과에서 성적이 가장 좋은 세 가지 재작성 전술은 이미 1위였던 출처의 가시성을 20–30% 깎았고, 5위였던 출처는 대략 두 배로 만들었습니다. 즉 같은 전술이 도전자에게는 이득이고 선두에게는 비용입니다.

아래 표는 출처의 원래 Google 순위별 가시성 상대 변화이며, KDD 2024 논문 자신의 결과 표에서 가져왔습니다. 이 표를 인용하는 사람은 거의 없습니다.2

재작성 전술그 출처가 원래 1위였다면5위였다면
출처 인용−30.3%+115.1%
인용문 추가−22.9%+99.7%
통계 추가−20.6%+97.9%
권위적인 어조−6.0%+6.1%
유창성 최적화−2.0%+2.2%

이 전술들은 가시성을 무에서 만들어 내는 대신 답변의 비중을 순위가 낮은 출처 쪽으로 재분배합니다. 보편적 상승이 아니라 평준화 효과이고, 누가 채택해야 하는지를 바꿉니다. 여러분이 5위의 도전자라면 이 측정에서 상방은 큽니다. 어떤 쿼리의 1위 결과를 이미 갖고 있다면, 공격적인 재작성은 가장 좋은 자산에 거는 하방 위험이고, 그렇게 말하는 것은 같은 논문의 수치입니다.

실전 규칙은 멋이 없습니다. 아직 이기지 못하는 페이지에서 테스트하고, 변경은 되돌릴 수 있을 만큼 작게 유지하고, 한 장의 전후 스크린샷을 결과로 읽는 대신 반복 실행에 걸쳐 노출과 인용을 따로 측정하십시오.

점검

널리 퍼진 주장 가운데 이 테스트를 곧장 통과하지 못하는 것은?

가장 많이 되풀이되는 GEO 주장 네 가지는 단계 테스트를 곧장 통과하지 못합니다. 헤드라인이 된 백분율 상승, AI 인용 전체에서 단일 플랫폼이 차지하는 비중, 인용 레버로서의 schema 마크업, 그리고 가시성 파일로서의 llms.txt입니다. 아래에 각각을 정정과 함께 그대로 적었습니다.

단계 테스트에 떨어지는 것

  • “GEO가 가시성을 40% 높인다”는 2026년 비판적 서베이가 일반적 주장으로는 기각합니다: 한 가지 구성에서 한 지표에 대한 상대적 최댓값이고, 이미 컨텍스트 안에 있는 페이지에 대한 값이기 때문입니다
  • “schema 마크업을 추가하면 AI 인용이 늘어난다”는 성립하지 않습니다. 유일한 매치드 컨트롤 테스트인 1,885개 페이지 대 4,000개 대조 페이지는 AI Overviews에서 −4.6%를 측정했고, Google도 특별한 schema.org 데이터가 필요 없다고 밝힙니다
  • “AI 텍스트 파일을 공개하면 엔진이 찾아온다”는 성립하지 않습니다. Google은 Search 자체가 그런 파일을 쓰지 않는다고 밝히며, 137,210개 도메인 연구는 그중 97%가 요청을 한 건도 받지 못했음을 발견했습니다
  • “어느 포럼 하나가 AI 인용의 40.1%를 차지한다”는 응답당 노출률 도표로 거슬러 올라가는데, 공개된 값의 합이 약 208%이고 그것들은 애초에 비중이 아니었습니다
  • “AI 인용의 X%는 오가닉 상위 10위에서 나온다”는 분모와 날짜 없이는 읽을 수 없습니다. 발표된 수치는 대략 6분의 1에서 4분의 3 이상까지 걸쳐 있습니다
  • “JavaScript를 렌더링하는 AI 크롤러는 없다”는 2024년 12월 로그 연구 한 건에만 근거하고, 한 번도 재현되지 않았으며, Google과 Applebot과 에이전트형 브라우저에 대해서는 틀렸습니다
  • “AI의 키워드에 맞춰 페이지를 최적화하라”는 성립하지 않습니다. 키워드 스터핑은 KDD 2024 결과에서 아무것도 하지 않는 것보다 점수가 낮았던 유일한 전술입니다

단계 테스트에서 살아남는 것

  • 색인되고 스니펫 노출 자격이 있을 것: 엔진이 직접 밝힌 요건, 3단계
  • JavaScript 없이도 텍스트를 돌려줄 것: 무료이고, 3단계의 엔진별 위험 하나를 없앱니다
  • 학습용 토큰이 아니라 검색 봇 토큰을 확인할 것: 모든 벤더가 문서에서 이를 나눠 둡니다
  • 실제 하위 질문에 진짜로 관련될 것: 서베이에서 가장 강한 레버
  • 그 하위 질문에 첫 문장에서 답하고, 그것만으로 완결될 것: 4단계
  • 본문에 실제의, 날짜가 있고, 출처가 붙은 숫자와 평이한 정의를 둘 것: 4단계와 5단계
  • 엔진별로, 반복 실행에 걸쳐 보고하고, 리트리벌과 인용과 정확도를 나눌 것
남는 것

무엇이 테스트에서 살아남습니까?

살아남는 것은 2026년 비판적 서베이가 한 문장으로 말하는 짧고 지루한 목록입니다. “관련성 있고, 포괄적이고, 검증 가능하고, 구조가 분명하고, 기술적으로 검색 가능한 페이지를 만들라. 그런 다음 리트리벌, 인용, 충실도를 따로 측정하라.”3 그 문장의 모든 절이 일을 합니다. 관련성은 3단계입니다. 포괄성은 2단계입니다. 팬아웃이 하위 질문마다 리트리벌하기 때문입니다. 검증 가능성과 분명한 구조는 4단계입니다. 기술적 검색 가능성은 그 모든 것 앞에 놓인 관문입니다. 그리고 세 결과를 따로 측정하는 것이, 한 분기를 통째로 엉뚱한 것을 최적화하는 데 쓰지 않게 막아 줍니다.

Google 자신의 문서는 이와 양립하는, 심지어 더 짧은 말을 하고, 어떤 벤더가 다른 말을 할 때 붙들고 있을 만합니다. AI 기능에 보조 링크로 나타나려면 “페이지가 색인되어 있고 스니펫과 함께 Google 검색에 표시될 자격이 있으며, 검색의 기술 요건을 충족해야 합니다”. 그리고 “이 기능들에 나타나기 위해 새로운 기계 판독 파일이나 AI 텍스트 파일, 마크업을 만들 필요는 없습니다”.5 그 선 위에서 팔리는 모든 것은 자기가 어느 단계에 작용하는지, 그리고 거기서 그것을 측정한 연구가 무엇인지 댈 수 있어야 합니다.

이 글의 정직한 한계

이 진단법은 주장을 메커니즘으로 분류하지, 참인지 거짓인지로 분류하지 않습니다. 어떤 주장은 맞는 단계를 짚고도 틀릴 수 있고, 어떤 주장은 이 테스트를 통과하지 못하고도 아직 아무도 제대로 측정하지 않은 실재하는 무언가를 가리킬 수 있습니다. 이렇게 젊은 분야에서 근거의 부재는 부재의 근거로는 약하기 때문입니다. 위의 반박 가운데 둘은 단일 연구에 기대고 있고, 그것이 바로 그 반박들이 지적하는 잘못입니다. schema 결과는 원래도 많이 인용되던 페이지를 대상으로 한 매치드 컨트롤 테스트 한 건이고, JavaScript 결론은 2024년 12월의 로그 연구 한 건입니다. 이 시스템들은 또 달마다 바뀌므로, 날짜가 붙은 널 결과는 그 날짜의 널 결과입니다. 여기서 6개월이 넘은 것은 무엇이든 실행에 옮기기 전에 다시 확인하십시오.

제품이 쓸모 있는 자리와 그렇지 않은 자리

진단법 자체가 산출물이고, 무료입니다. 최근에 받은 GEO 조언 다섯 개를 꺼내 각각 옆에 작용하는 단계 번호를 적고, 단계를 대지 못하는 것은 지우십시오. 그런 다음 살아남은 것들을 아직 이기지 못하는 페이지에서 작고 되돌릴 수 있는 실험으로 돌리고, 스크린샷 한 장이 아니라 반복 실행에 걸쳐 측정하십시오. Bavior는 마지막 측정 문제에서만 돕습니다. 고정된 프롬프트 묶음을 다섯 개 엔진에 일정에 맞춰 돌리고 각 답변이 어떤 출처를 인용했는지 기록하므로, 변화는 일화가 아니라 분포의 이동으로 드러납니다. 인용된 출처가 살아 있는 토론 스레드일 때는 여러분이 관리하는 계정으로 답글 초안을 작성하고, 무엇이든 게시되기 전에 여러분이 승인합니다. GEO 조언을 대신 감사해 주지 않고, 페이지를 재작성하지 않으며, 인용이나 순위를 약속할 수 없습니다. 무료 AI 가시성 체커무료 GEO 진단은 유료 플랜 없이 이용할 수 있습니다. 유료 플랜은 월간 결제 시 월 $99부터, 연간 결제 시 월 $79.17입니다(2026년 8월 29일 기준).

출처: 모두 2026년 8월 29일 확인
  1. Kim 외, “SAGEO Arena: A Realistic Environment for Evaluating Search-Augmented Generative Engine Optimization”, KDD 2026, arXiv:2602.12187. arxiv.org/abs/2602.12187
  2. Aggarwal, Murahari, Rajpurohit, Kalyan, Narasimhan, Deshpande, “GEO: Generative Engine Optimization”, KDD 2024, arXiv:2311.09735(원래 순위별 상대 변화와 키워드 스터핑 결과). arxiv.org/abs/2311.09735
  3. “Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)”, 2026년 7월 15일, arXiv:2607.14035(확신도 표, 그리고 40% 일반화에 대한 기각). arxiv.org/abs/2607.14035
  4. Puerto, Gubri, Green, Oh, Yun, “C-SEO Bench: Does Conversational SEO Work?”, NeurIPS 2025 Datasets & Benchmarks Track, arXiv:2506.11097. arxiv.org/abs/2506.11097
  5. Google Search Central(1차 출처). “AI features and your website”, 최종 업데이트 2025년 12월 10일, 이 글의 두 인용문 모두 이 페이지에서 나왔습니다: developers.google.com/search/docs/appearance/ai-features. “Optimizing your website for generative AI features on Google Search”, 최종 업데이트 2026년 7월 10일: developers.google.com/search/docs/fundamentals/ai-optimization-guide
  6. 구조화 데이터 매치드 컨트롤 연구, 2026년 5월: 2025년 8월과 2026년 3월 사이에 JSON-LD를 추가한 1,885개 페이지를 4,000개 대조 페이지와 짝지어 전후 30일의 인용을 측정. AI Overviews −4.6%(유의), 다른 서피스는 유의하지 않음. 벤더 공개 자료이므로 이 커리큘럼의 출처 규칙에 따라 링크하지 않고 설명만 합니다.
  7. AI 텍스트 파일 연구, 2026년 6월: 도메인 137,210개. 그런 파일의 97%가 요청을 한 건도 받지 못했고, 존재하지 않는 파일을 찔러 본 봇도 없었습니다. 벤더 공개 자료이므로 이 커리큘럼의 출처 규칙에 따라 링크하지 않고 설명만 합니다.
  8. 가장 많이 인용되는 도메인 연구, 2025년 11월: 프롬프트 230,000건, 인용 1억 건 이상, 2025년 7월부터 10월. 어느 대형 포럼에 대한 한 엔진의 인용률이 한 달 안에 약 50포인트 움직였고, 널리 인용되는 40.1%라는 수치는 합이 약 208%가 되는 응답당 노출률로 거슬러 올라갑니다. 벤더 공개 자료이므로 이 커리큘럼의 출처 규칙에 따라 링크하지 않고 설명만 합니다.
FAQ

자주 묻는 질문입니다.

“GEO가 가시성을 40% 높인다”는 사실인가요?

이 분야의 2026년 비판적 서베이는 이를 일반적 주장으로 기각하며, 그 수치가 “특정 구성에서 한 지표에 대한 상대적 최댓값”이라고 밝힙니다. 바탕이 된 결과는 답변의 단어 가운데 얼마가 여러분의 출처로 인정되는지를 재는 지표인 위치 조정 단어 수가 19.3에서 27.2로 오른 것이고, 그것은 Google 상위 5개 결과를 가져와 GPT-3.5가 그 위에 쓰게 한 목적용 엔진 안에서 일어났으며, 최적화된 페이지는 이미 그 다섯 건 안에 있었습니다. 이것은 한 단계에 대한 진짜 측정입니다. 열린 웹의 페이지에 재작성이 무엇을 하는지에 대한 예측이 아닙니다.

schema 마크업을 추가하면 AI 검색이 나를 더 많이 인용하나요?

이용할 수 있는 유일한 매치드 컨트롤 테스트는 아니라고 말하고, 엔진 자신의 문서도 같은 말을 합니다. 그 연구는 2025년 8월과 2026년 3월 사이에 JSON-LD를 추가한 1,885개 페이지를 한 번도 추가하지 않은 4,000개 대조 페이지와 짝지어 전후 30일의 인용을 측정했고, AI Overview 인용이 4.6% 줄었으며 다른 서피스에는 유의한 변화가 없음을 발견했습니다. Google은 자사 AI 기능에 나타나기 위해 “추가해야 하는 특별한 schema.org 구조화 데이터도 없다”고 직접 밝힙니다. schema는 리치 결과와 기계 판독성 위생을 위해 배포하십시오. AI 인용의 레버로 취급하지는 마십시오.

이미 1위라면 그 페이지에 GEO 재작성을 적용해야 하나요?

조심하십시오. 최초 논문 자신의 결과 표는 이 전술들이 이미 1위였던 출처에 인정되는 답변 비중을 측정 가능한 수준으로 줄인다는 것을 보여 줍니다. 출처 인용 −30.3%, 인용문 추가 −22.9%, 통계 추가 −20.6%이고, 5위였던 출처는 대략 두 배였습니다. 이 전술들은 답변 비중을 순위가 낮은 출처 쪽으로 재분배하므로, 보편적 상승이 아니라 평준화 효과입니다. 아직 이기지 못하는 페이지에서 테스트하고, 변경은 되돌릴 수 있을 만큼 작게 유지하며, 한 번의 전후 확인이 아니라 반복 실행에 걸쳐 측정하십시오.

어떤 GEO 연구가 실행에 옮길 가치가 있는지 어떻게 판단하나요?

네 가지 질문을 순서대로 하십시오. 이 주장은 파이프라인의 어느 단계에 작용합니까? 해석이나 팬아웃이라면 그 단계들은 여러분의 사이트에서 입력을 받지 않으므로 메커니즘이 없습니다. 측정할 때 리트리벌과 재순위화가 돌고 있었습니까, 아니면 문서가 미리 모델의 컨텍스트에 놓였습니까. 분모와 날짜는 무엇입니까. 답변당 비중과 인용당 비중은 수십 포인트 차이가 나고, 이 시스템들은 달마다 바뀌기 때문입니다. 그리고 그 효과는 널리 채택되어도 살아남습니까? NeurIPS 2025 벤치마크는 같은 전술을 채택하는 주체가 늘수록 이득이 줄어드는 것을 발견하고, 이 문제를 “혼잡하고 제로섬”이라고 불렀습니다.

Bavior 편집팀

Reddit 마케팅과 AI 검색 가시성에 관한 Bavior의 콘텐츠를 조사하고 관리하는 팀입니다. 본문의 모든 수치에는 출처와 확인 날짜를 명시했으며, 제휴 링크는 사용하지 않습니다.

수치에 오류를 발견하셨나요? 알려주시면 다시 확인하겠습니다: support@bavior.com

단계를 대지 못하면 그 전술은 버리십시오.
그런 다음 실제로 무엇이 움직였는지 측정하십시오.

무료 체험 시작