/GEO 배우기/효과가 확인되지 않는 전술
AI 인용을 위한 콘텐츠 · 방법

왜 대부분의 콘텐츠 전술은 널 결과가 나오나?

그 효과는 애초에 테스트가 볼 수 있는 크기보다 작습니다. 널 결과는 전술에 관한 사실이기 이전에 여러분의 측정에 관한 사실이며, 그 둘을 구분하는 것이 이 일의 대부분입니다.

이 페이지의 내용
이 글 공유하기
X에 공유 LinkedIn에 공유
짧은 답

널 결과란 그 테스트가 효과를 보지 못했다는 뜻이며, 이는 전술에 관한 진술이기 이전에 테스트에 관한 진술입니다. 이것을 정상적인 결과로 예상하십시오. C-SEO Bench는 6개 도메인에 걸쳐 열 가지 대화형 SEO 방법을 측정한 NeurIPS 2025 벤치마크인데, 54개의 방법과 도메인 조합 가운데 유의미하게 긍정적인 것은 3개뿐이었습니다. 그리고 그 결과 표에서는 열 가지 방법 모두가 자기 평균보다 큰 표준편차를 가지며, 대개는 몇 배 더 큽니다.1 그런 모양의 숫자로는 작은 효과를 분간할 수 없습니다.

핵심 요약
  • 널 결과가 대부분인 이유는 효과가 작고, 같은 편집이 어떤 쿼리에는 도움이 되고 다른 쿼리에는 해가 되며, 완전히 동일한 실행 사이에서도 답변이 바뀌기 때문입니다.
  • 어떤 전술이 아무 효과도 없다고 주장하려면, 여러분이 행동에 옮길 최소 효과를 배제하는 구간이 필요합니다. 이 분야의 서베이는 아직도 연구들에 평균이 아니라 구간과 분포를 요구해야 하는 상황입니다.3
  • 부정적 결과는 훨씬 더 많은 정보를 담습니다. KDD 2026의 SAGEO Arena는 본문만 재작성하는 방식이 테스트한 열 가지 전략 모두에서 리트리벌, 재순위화, 인용 전부에서 뒤처진다는 것을 확인했습니다.2
  • 자신의 널 결과는 지난달과 비교하지 말고, 손대지 않은 대조 페이지와 비교해 읽으십시오. AI Overviews의 두 달간 페이지 중복률은 18%이고 Google 자연 검색결과는 45%입니다.4
사전 판단

왜 여기서는 널 결과가 예상된 결과인가?

콘텐츠 편집은 파이프라인 마지막 단계에서의 작은 개입이고, 그것을 재는 계기 자체가 스스로 움직이기 때문입니다.

찾고 있는 것의 크기부터 봅시다. C-SEO Bench는 NeurIPS 2025 Datasets and Benchmarks Track에서 발표됐고, 6개 도메인과 1.9k건이 넘는 쿼리에 걸쳐 총 열 가지 콘텐츠 방법을 돌렸습니다. 소매 열에서 열 가지 중 가장 강한 방법은 대상 문서를 0.36 순위만큼 움직였고 가장 약한 것은 −0.07이었습니다. 반면 그 문서를 모델 컨텍스트의 맨 앞에 놓는 것, 즉 순위가 하는 일의 값어치는 2.77이었습니다.1 순위 3분의 1은 단지 검출하기 어려운 정도가 아닙니다. 월요일에 여러분이 할 일을 바꾸기에는 너무 작습니다.

계기도 함께 움직입니다. 온도를 제어할 수 있는 환경에서는 온도 0으로 반복 실행할 때 4,706건의 쿼리에 걸쳐 판단의 9–28%가 바뀝니다.4 같은 질문을 두 번 하면 그것은 같은 실험이 아닙니다. 그 흔들림보다 작은 효과는 구조상 보이지 않습니다.

그리고 모집단이 있습니다. C-SEO Bench는 그 이동이 “양의 방향과 음의 방향 모두로 나타나며 서로 부분적으로 상쇄된다”고 보고합니다. 소매에서 가장 강한 방법은 26.2%의 사례에서 도움이 됐고 12.8%의 사례에서 해가 됐으며, 그래서 “전체 평균 효과는 0에 가깝지만 분산이 크다”는 것입니다.1 54개 사례 중 3개가 Holm-Bonferroni 보정 이후에도 유의미하게 긍정적이었으므로, 그 셋은 여러 방법을 한꺼번에 검정해서 생긴 허상이 아닙니다.1

산포

평균보다 큰 표준편차는 무엇을 말해주나?

개별 쿼리 하나하나에서는 결과를 정하는 것이 여러분이 적용한 전술이 아니라 그것이 어떤 쿼리인가라는 뜻입니다. 소매 열에서 가장 좋은 콘텐츠 방법은 0.36 ±1.47이고, 기준으로 놓인 SEO 조치, 즉 표에서 가장 강한 숫자조차 2.77 ±2.31입니다.1 퍼짐 자체가 발견입니다. 같은 개입 아래에서 한 문서는 네 자리를 올라갈 수도, 세 자리를 내려갈 수도 있습니다.

여기서 세 가지 귀결이 따라옵니다. 프롬프트 하나에서 페이지 하나의 전후를 비교하는 것은 그 분포에서 한 번 뽑은 것이므로, 평균에 대해 어느 방향으로도 정보를 거의 담지 못합니다. 양의 평균은 상당한 비율의 손실과 양립합니다. 그래서 2026년 비판적 서베이의 방법론 장은 “절대 효과, 상대 효과, 구간, 분포이지 단순한 평균이 아니다”라고 요구합니다.3 그리고 필요한 관측 수는 분산에 따라 늘고 효과의 제곱에 따라 줄기 때문에, 넓은 분포 안의 작은 효과는 보는 것 자체가 비쌉니다.

그 계산은 이 사이트의 다른 글에 있습니다. 통계적 검정력은 주어진 변화 폭에 대해 기간당 몇 건의 관측이 필요한지 알려주고, 패널 규모는 그것을 실제로 운영할 수 있는 패널로 바꿔 줍니다. 둘 다 테스트를 설계하기 전에 읽으십시오. 결과를 읽은 뒤가 아닙니다.

널 결과가 아닌 것

널 결과는 그 전술이 아무 효과도 없다는 뜻인가?

아닙니다. 그리고 그 두 문장 사이의 틈이 바로 대부분의 GEO 보고가 어긋나는 자리입니다. “효과를 검출하지 못했다”와 “효과가 없다는 것을 검출했다”는 서로 다른 주장입니다. 앞의 것에는 테스트만 있으면 됩니다. 뒤의 것에는 여러분이 행동에 옮겼을 모든 효과 크기를 배제할 만큼 좁은 구간이 필요한데, 그것은 만들기가 훨씬 어렵고 발표된 것을 보기도 더 드뭅니다.

이것을 바로잡는 규율은 돈이 들지 않고 테스트 전에 이뤄집니다. 행동에 옮길 최소 변화를 적어 두고, 여러분의 패널이 그것을 분간할 수 있는지 확인하십시오. 관측 30건짜리 패널은 출현율 50%에서 95% Wilson 구간이 대략 ±17포인트이므로, 진짜로 존재하는 5포인트 상승도 돌릴 때마다 널 결과로 읽힙니다. 그 결과는 테스트의 규모가 정한 것이며, 그것을 미리 아는 것은 그 테스트를 건너뛸 이유가 됩니다.

거울처럼 뒤집힌 오류에도 이름을 붙여 둘 만합니다. 0.36 순위라는 효과에 대한 널 결과는 그 효과가 실재한다는 것과도, 그것이 여러분에게 아무 값어치도 없다는 것과도 양립합니다. 그래서 널 결과와 아주 작은 참된 효과는 어차피 같은 결정으로 이어집니다.

방향

부정적 결과는 널 결과와 어떻게 다른가?

널 결과는 방향을 주지 않으므로 사전 판단은 그대로입니다. 여러 전략과 여러 단계에 걸쳐 부호가 일치하면 방향과 메커니즘을 함께 얻습니다.

본문만 재작성리트리벌, 상위 20 히트율재순위화 후, 상위 10 히트율인용률
베이스라인, 재작성 없음0.581.000.50
유창성0.57 (−1%)0.91 (−9%)0.50 (−1%)
통계0.57 (−2%)0.90 (−10%)0.48 (−4%)
전문 용어0.50 (−14%)0.80 (−20%)0.47 (−6%)
여덟 가지 동시에0.50 (−14%)0.83 (−17%)0.49 (−2%)
열 가지 평균0.53 (−9%)0.84 (−16%)0.47 (−6%)

KDD 2026에 채택된 SAGEO Arena는 모델에 고정된 컨텍스트를 건네는 대신 파이프라인 전체를 다시 만들었습니다. 문서 171,003건과 쿼리 2,700건, 리트리벌과 재순위화와 생성이 모두 작동합니다. 본문만 최적화하는 것은 “모든 단계에 걸쳐 일관되게 가시성을 떨어뜨린다”고 보고되며, 위의 표가 바로 그 문장이 허용되는 이유입니다. 열 가지 전략이 세 열 모두에서 떨어집니다.2 서른 개의 칸, 하나의 부호. 단계들은 독립이 아니라 중첩돼 있으므로 그것은 서른 번의 개별 시행이 아닙니다. 그래도 열 가지 서로 다른 재작성이 저마다 닿는 모든 단계에서 같은 방향으로 움직인다면 그것은 방향이지 동전 던지기가 아닙니다.

메커니즘은 추측이 아니라 명시돼 있고, 그것이 이것을 널 결과보다 위로 끌어올립니다. 리트리벌에서 가장 크게 떨어진 것은 흔한 단어를 더 드문 단어로 바꾸는 전략들이며, 저자들은 이를 “최적화된 문서와, 보통 일반적인 어휘를 쓰는 사용자 쿼리 사이의 어휘 불일치”로 돌립니다.2 C-SEO Bench는 반대편에서 같은 비대칭을 찾아냈습니다. 좌측 검정 결과, 통계를 더하는 방법은 평가된 24개 설정 중 19개에서 순위를 떨어뜨렸습니다.1 이 벤치마크들이 해악을 검정한 자리에서는 자주 실제로 해악을 찾아냈습니다. 이는 도움을 찾지 못한 것과는 다른 인식 상황입니다.

누군가 그 표를 인용하기 전에 정직하게 덜어낼 점이 둘 있습니다. 재순위화 베이스라인은 구조상 1.00입니다. “모든 대상 문서는 재순위화 단계의 상위 10개 후보에서 선택된다”고 했기 때문이며, 그래서 그 열은 내려갈 수밖에 없습니다.2 그리고 본문만 바꾸는 것은 보고된 세 가지 설정 중 하나입니다. 구조를 본문과 함께 최적화하면 숫자는 달라집니다.

자신의 테스트

내 사이트의 널 결과는 어떻게 읽나?

여섯 가지 질문을 이 순서대로 던지십시오. 사내에서 나온 널 결과 대부분은 앞의 네 가지 중 하나에서 멈춥니다.

01

그 효과는 애초에 검출 가능했나?

행동에 옮길 만한 최소 변화를 적고, 그 크기에서 여러분의 패널이 주는 구간을 확인하십시오. 구간이 변화보다 넓다면 그 널 결과는 테스트가 돌기 전에 이미 쓰여 있던 것입니다.

02

그 편집은 실제로 배포됐나?

변경한 페이지를 크롤러가 하듯 가져와 새 텍스트가 응답에 들어 있는지 확인하십시오. 리트리벌 가능해지지 않은 재작성이 만들어내는 것은 배포에 관한 널 결과이며, 그것이 숨는 자리가 리트리벌입니다.

03

베이스라인은 가만히 있었나?

두 달 사이의 페이지 중복률은 AI Overviews가 18%, Google 자연 검색결과가 45%입니다.4 그 간격을 건너뛴 전후 비교가 재는 것은 대부분 교체입니다. 손대지 않은 페이지를 대조군으로 남겨 두십시오.

04

한 번에 하나만 바꿨나?

묶음으로 낸 것이 널 결과라 해도 그 구성 요소에 대해서는 아무것도 말해주지 않으며, 이득이 손실을 상쇄하는 것을 가릴 수 있습니다. 위의 “여덟 가지 동시에” 조건은 리트리벌에서 −14%에 도달했고, 이는 그 재료 대부분보다 나쁩니다.

05

실패한 것들을 남겼나?

서베이는 가장 흔한 침묵의 편향에 대해 직설적입니다. “검색이 없는 출력, 인용이 없는 출력, 오류가 있는 출력은 버릴 데이터가 아니라 결과다.”3 그것들을 빼면 모든 비율이 부풀려집니다.

06

각 실행을 독립적인 것으로 다뤘나?

“쿼리, 출처, 날짜는 군집된 단위다. 모든 생성을 독립인 것처럼 검정하면 불확실성을 과소평가한다.”3 프롬프트 하나를 다섯 번 돌린 것은 다섯 개의 관측이 아닙니다.

한 팀이 릴리스 한 번에 문서 페이지 마흔 개를 재작성하고, 그 전후 한 달씩을 서른 건짜리 패널로 비교한다면 거의 매번 널 결과를 보고할 것이고 그 재작성에 대해서는 아무것도 배우지 못할 것입니다. 위 여섯 질문 중 셋은 이미 틀리게 답했습니다. 패널은 약 17포인트 미만을 분간하지 못하고, 여덟 가지 변경이 하나로 배포됐으며, 비교 기간은 그 면이 스스로 한 바퀴 갈리기에 충분히 깁니다. 같은 팀이 스무 페이지를 재작성하고 스무 페이지를 손대지 않은 채 남기면서 패널 규모를 먼저 계산했다면, 답이 “아무것도 움직이지 않았다”일 때조차 가질 만한 답을 얻습니다.

결정

널 결과가 나온 전술은 어떻게 하나?

유의성이 아니라 비용과 위험으로 결정하십시오. 여러분이 사려던 것은 애초에 유의성이 아니었습니다. 값이 싸고 해가 없으며 다른 이유로도 정당화되는 전술은 널 결과를 온전히 견뎌냅니다. 질문형 소제목, 평이한 정의, 날짜와 출처가 붙은 숫자는 페이지를 읽기 좋게 만듭니다. 그러니 인용 효과는 덤이지 그것을 하는 이유가 아닙니다. 값은 싸지만 기록된 부작용을 지닌 전술, 이를테면 독자가 쓰는 단어를 더 드문 단어와 맞바꾸는 것은 널 결과가 아니라 반대쪽 꼬리의 증거에서 무너집니다. 비싸면서 널 결과가 나온 전술은 멈춰야 합니다. 그 진짜 비용은 여러분이 아무것도 측정하지 않은 제약이기 때문이고, Google은 지금도 자사의 생성형 기능을 “우리의 핵심 검색 순위 및 품질 시스템에 뿌리를 두고 있다”고 설명합니다.6

한계 전술의 가치를 측정값보다 낮추는 성질이 하나 더 있습니다. 같은 벤치마크는 후보 집합 안에서 같은 방법을 채택하는 문서가 늘어날수록 전체 이득이 줄어든다고 보고하며 “이 문제의 혼잡하고 제로섬적인 성격을 보여준다”고 적었습니다.1 긍정적 결과는 감가상각되는 자산이지만, 질문에 진짜로 답하는 페이지는 그렇지 않습니다. 제대로 읽은 널 결과는 낭비한 분기가 아닙니다. 그것은 여러분의 제약이 여기에 없다는 지도이고 대개 상류를 가리키며, 그다음은 GEO 전술은 효과가 있나관련성과 순위가 이어받습니다.

이 글의 정직한 한계

위의 모든 숫자는 연구자들이 직접 만든 실험 장치에서 나왔습니다. 두 벤치마크 모두 살아 있는 상용 엔진을 엔드투엔드로 질의하지 않았고, 둘 다 자체 리트리벌을 사용하며, 판정은 각자가 돌린 모델에 속합니다. 그래서 “이 전술은 널 결과다”라는 말은 “거기서, 그때 널 결과였다”라고 해야만 정확합니다. C-SEO Bench가 측정하는 것도 인용이 아니라 순위 개선이며, 둘은 관련은 있지만 같은 결과 지표가 아닙니다. 방법론 표현을 제공한 서베이는 프리프린트이고, 중복률과 반복 실행 수치는 그것을 거쳐 이 페이지에 도달했습니다. 이 글이 주장하지 않는 것은 이 전술들이 여러분의 도메인에서 무가치하다는 것입니다. 이 글이 주장하는 것은 발표된 테스트들이 작은 효과를 볼 수 없었다는 것입니다.

제품이 쓸모 있는 자리와 그렇지 않은 자리

이 페이지의 어떤 것도 소프트웨어를 필요로 하지 않습니다. 행동에 옮길 만한 최소 효과를 적어 두는 것, 패널 규모를 먼저 계산하는 것, 페이지 일부를 대조군으로 남겨 두는 것, 한 번에 하나만 바꾸는 것은 모두 공짜이며, 읽을 수 있는 널 결과와 읽을 수 없는 널 결과를 가르는 것은 전적으로 이것들입니다. 소프트웨어가 제공하는 것은 그 아래의 반복 측정입니다. Bavior는 정해진 프롬프트 묶음을 다섯 개 엔진에 정기적으로 돌리고 각 답변이 어떤 출처를 인용했는지 기록합니다. 그래서 비교의 뒤에는 스크린샷이 아니라 분포가 있습니다. 여러분의 실험을 설계해 주지 않고, 유의성을 계산하지 않으며, 페이지를 재작성하지 않고, 어떤 전술이 여러분의 도메인에서 효과가 있는지도 알려주지 못합니다. 그 숫자에 나타난 널 결과는 측정의 널 결과이지 세계의 널 결과가 아닙니다. 무료 AI 가시성 체커무료 GEO 진단은 유료 플랜 없이 이용할 수 있습니다. 유료 플랜은 월간 결제 시 월 $99부터, 연간 결제 시 월 $79.17입니다(2026년 8월 30일 기준).

출처, 모두 2026년 8월 30일 확인
  1. Puerto, Gubri, Green, Oh, Yun, “C-SEO Bench: Does Conversational SEO Work?”, NeurIPS 2025 Datasets & Benchmarks Track. 열 가지 방법, 1.9k건이 넘는 쿼리. 표 3과 §6.2, Holm-Bonferroni 보정을 적용한 우측 Wilcoxon 부호순위 검정: arxiv.org/abs/2506.11097
  2. Kim, Jeong, Kim, Lee, Lee, “SAGEO Arena”, KDD 2026 채택, arXiv:2602.12187v2. 문서 171,003건, 쿼리 2,700건, 표 2의 본문만 재작성 열: arxiv.org/abs/2602.12187
  3. “Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)”, 2026년 7월 15일, arXiv:2607.14035(프리프린트). §11.2와 §11.3: arxiv.org/abs/2607.14035
  4. Kirsten 외, Findings of ACL 2026. 쿼리 4,706건. AI Overviews의 두 달간 페이지 중복률 18%, Google 자연 검색결과 45%, 온도 0에서 반복 실행 시 판단의 9–28% 변화. 모두 주 3의 서베이 §6.2를 거쳐 보고된 수치: aclanthology.org/2026.findings-acl.526
  5. Aggarwal 외, “GEO: Generative Engine Optimization”, KDD ’24, arXiv:2311.09735. 이후 두 벤치마크가 다시 검증한 열 가지 전략 중 여덟 가지의 출처: arxiv.org/abs/2311.09735
  6. Google Search Central, “Google’s Guide to Optimizing for Generative AI Features on Google Search”, 2026년 7월 10일 업데이트(1차 출처, “뿌리를 두고 있다”는 문장): developers.google.com/search/docs/fundamentals/ai-optimization-guide
FAQ

자주 묻는 질문입니다.

널 결과는 콘텐츠 전술이 효과가 없다는 것을 증명하나?

아닙니다. 널 결과는 그 테스트가 효과를 검출하지 못했다는 뜻이며, 이는 효과 크기와 분산과 관측 수에 달려 있습니다. 어떤 전술이 아무 효과도 없다고 주장하려면 여러분이 행동에 옮겼을 모든 변화를 배제하는 구간이 필요한데, 이는 들리는 것보다 드뭅니다. 그것이 없다면 정직한 보고는 답이 “아니오”였다가 아니라 그 테스트에 답할 만한 분해능이 없었다는 것입니다.

널 결과가 의미를 가지려면 콘텐츠 테스트에 몇 건의 관측이 필요한가?

결과 주위의 구간이 여러분이 행동에 옮길 최소 변화보다 좁아질 만큼입니다. 관측 30건에서 95% Wilson 구간은 대략 플러스마이너스 17포인트이므로 그보다 작은 것은 보이지 않습니다. 주어진 효과 크기에 필요한 표본 크기 계산은 통계적 검정력 글에, 그 관측을 만들어내는 패널 설계는 패널 규모 글에 있습니다.

왜 부정적 결과가 널 결과보다 더 쓸모 있나?

방향이 있고 대개는 메커니즘도 있기 때문입니다. SAGEO Arena는 본문만 재작성하는 열 가지 전략 모두가 리트리벌, 재순위화, 인용에서 떨어지는 것을 확인했고, 리트리벌 손실을 어휘 불일치로 돌렸습니다. 흔한 단어를 더 드문 단어로 바꾸면 리트리버가 점수를 매기는 겹침이 줄어듭니다. 널 결과는 사전 판단을 그대로 두지만, 여러 전략에 걸쳐 일치하는 부호는 다음에 할 일을 바꿉니다.

널 결과가 나온 일은 그만둬야 하나?

대신 비용과 위험으로 결정하십시오. 값이 싸고 사람 독자에게 도움이 되는 소제목이나 정의처럼 다른 이유로도 정당화된다면 계속하되, 그것에 인용 효과가 있다는 주장은 그만두십시오. 기록된 부작용이 있다면 버리십시오. 비쌌다면 멈추십시오. 그 진짜 비용은 여러분이 아무것도 측정하지 않은 상류의 제약이기 때문입니다.

Bavior 편집팀

Reddit 마케팅과 AI 검색 가시성에 관한 Bavior의 콘텐츠를 조사하고 관리하는 팀입니다. 본문의 모든 수치에는 출처와 확인 날짜를 명시했으며, 제휴 링크는 사용하지 않습니다.

수치에 오류를 발견하셨나요? 알려주시면 다시 확인하겠습니다: support@bavior.com

읽을 수 있는 널 결과가
읽을 수 없는 숫자를 이깁니다.

무료 체험 시작