/GEO 배우기/방어 가능한 보고서
AI 가시성 측정 · 보고

방어 가능한 AI 가시성 보고서에는 무엇이 들어가나요?

모든 수치는 관측 수, 날짜 범위, 패널 버전을 달고 다닙니다. 그렇지 않으면 그 수치는 무엇과도 비교할 수 없습니다. 내 작업과 그 아래 플랫폼의 드리프트를 갈라내는 것이 홀드아웃 세트입니다.

이 페이지의 내용
이 글 공유하기
X에 공유 LinkedIn에 공유
짧은 답

방어 가능한 AI 가시성 보고서는 언급률과 인용률을 엔진별로 내놓고, 각각에 구간을 붙이고, 각각에 관측 수와 날짜 범위와 패널 버전을 찍습니다. 또 아무도 손대지 않은 프롬프트 홀드아웃 세트를 함께 들고 다니므로, 플랫폼 드리프트가 내 작업과 분리된 채로 남습니다. 엔진별 보고는 까다롭게 구는 것이 아닙니다. 쿼리 11,500건을 다룬 SIGIR 2026 연구는 Google 자연 검색결과, AI Overviews, Gemini 사이의 URL 수준 Jaccard 유사도를 0.11에서 0.18로 측정했습니다. 그러니 하나로 섞은 점수는 존재하지 않는 엔진을 설명하는 셈입니다.5

핵심 요약
  • 모든 수치에는 네 개의 도장이 따라붙습니다. 엔진, 관측 수, 날짜 범위, 패널 버전입니다. 하나라도 빠진 숫자는 지난달 숫자와 비교할 수 없습니다.
  • 패널의 유형 구성을 그대로 반영한 프롬프트 10~15개를 얼려 둔 홀드아웃이 내 효과와 엔진 드리프트를 갈라냅니다.
  • 페이지에서 빼십시오: 엔진을 가로지른 평균, 최소 검출 가능 효과보다 작은 변동에 붙인 화살표, 인용에서 추정한 매출.
출처 표기

페이지의 모든 수치에는 무엇이 따라붙어야 하나?

모든 숫자에는 네 가지가 따라붙습니다. 그렇지 않으면 그 숫자는 무엇과도 비교할 수 없습니다. 어느 엔진에서 나왔는지, 뒤에 몇 번의 관측이 있는지, 어느 기간을 담고 있는지, 그리고 그것을 만들어 낸 프롬프트 패널의 버전입니다. 이 중 하나가 빠진 수치는 측정이 아닙니다. 이번 달 값과 지난달 값이 같은 계기에서 나왔는지 독자가 알 수 없기 때문입니다.

패널 버전은 팀이 건너뛰는 항목이자, 1년치 이력을 조용히 무효로 만드는 항목입니다. 프롬프트를 여섯 개 더하면 모든 비율의 분모가 바뀝니다. 그래서 두 버전을 가로지른 29%에서 34%로의 상승은, 어떤 질문을 던졌는지가 만들어 낸 인공물일 수 있습니다. 두 자리로 된 버전을 쓰고, 모든 수치 옆에 찍으십시오. 마이너 올림은 프롬프트가 묻는 내용을 바꾸지 않는 문구 수정입니다. 이를 가로지른 비교는 각주 하나면 충분합니다. 메이저 올림은 프롬프트를 추가하거나 제거하거나 범위를 바꾼 경우입니다. 이때는 비교하지 말고 기준선을 다시 잡으십시오. 프롬프트 목록은 버전 관리에 두어 누구나 두 버전을 diff할 수 있게 하십시오.

여기서 일정 규칙이 하나 따라 나옵니다. 측정하려는 콘텐츠나 사이트 외부 작업과 같은 기간에는 절대로 패널을 바꾸지 마십시오. 그렇게 하면 두 원인은 되돌릴 수 없을 만큼 교란됩니다. 조용한 기간에 패널을 바꾸고, 기준선을 새로 잡고, 그다음에 움직이십시오.

구간도 수치에 따라붙습니다. 2026년 비판적 서베이가 GEO 연구에 요구하는 최소 체크리스트는 제품, 모드, 모델, 날짜, 로케일, 검색 활성화 여부, 여러 시간대에 걸친 반복 실행, 리트리벌과 생성의 분리, 그리고 널 결과를 분모에 남기는 것을 요구합니다.1 그 연구용 체크리스트를 충족하는 상업용 보고서란, 결국 바깥사람이 검증할 수 있는 보고서입니다.

대조군

홀드아웃 세트란 무엇이고, 보고서에 왜 필요한가?

홀드아웃 세트는 프롬프트 패널 가운데 의도적으로 손대지 않는 부분입니다. 그것을 위해 콘텐츠를 쓰지 않고, 그것을 겨냥한 사이트 외부 작업도 하지 않으며, 숫자가 나빠 보인다고 빼지도 않습니다. 엔진 전반의 드리프트가 내 작업과 따로 드러나게 하려고 존재합니다. 이것이 없으면 대시보드에서 상승과 플랫폼 업데이트는 구분되지 않고, 하락과 운 나쁜 한 달도 마찬가지입니다.

만드는 것은 패널을 만들 때 한 번뿐입니다. 프롬프트 10~15개면 충분하지만, 패널 나머지의 유형 구성을 그대로 반영해야 합니다. 유형마다 드리프트 속도가 다르므로, 정의형 질문만으로 만든 홀드아웃은 비교형 질문을 때린 변화를 따라가지 못합니다. 나머지 전부와 같은 버전 체계로 얼려 두고, 새로 온 팀원이 실수로 최적화하지 못하도록 표시해 두십시오.

이중차분으로 읽으십시오. 내 효과는 대략 작업한 집합의 변화에서 홀드아웃의 변화를 뺀 값입니다. 둘 다 8포인트 내려갔다면 움직인 것은 엔진이고, 여러분은 잘못한 것이 없습니다. 작업한 집합이 9포인트 오르고 홀드아웃이 평평하다면 근거를 손에 쥔 것입니다. 전후 비교 숫자를 내 작업에 대한 주장으로 바꾸는 것이 바로 이 뺄셈입니다.

정직한 한계가 둘 있습니다. 프롬프트 열두 개 남짓의 홀드아웃은 그 자체로 넓은 구간을 가집니다. 그래서 그 움직임은 정밀한 보정이 아니라 방향으로 읽으십시오. 잡음 있는 숫자에서 잡음 있는 숫자를 빼도 깨끗한 숫자가 되지 않으며, 이렇게 합친 비교에는 어느 한쪽만 볼 때보다 더 많은 데이터가 필요합니다(그 산수는 통계적 검정력 글에 있습니다). 그리고 이것이 통제해 주는 것은 두 집합에 똑같이 작용한 변화뿐입니다. 모델 교체는 잡아내지만, 여러분이 작업하던 질문을 겨냥한 경쟁사 캠페인은 잡아내지 못합니다.

이 모든 비용을 치를 이유는 플랫폼 드리프트가 크기 때문입니다. 2026년 비판적 서베이는 “상업용 엔진들은 서로 다르고 시간에 따라 변한다”를 확신도 높음으로 평가합니다.1 한 벤더의 시계열이 그 크기를 구체적으로 보여 줍니다. 2025년 7월에 표집한 AI Overview 인용 190만 건과 2026년 3월 키워드 결과 페이지 863,000개에 걸친 피인용 URL 400만 건 사이에서, 피인용 페이지 가운데 자연 검색 상위 10위에도 들어 있던 비율은 약 76%에서 약 38%로 떨어졌습니다.6 그 구간을 가로질러 홀드아웃 없이 전후 비교를 돌린 팀은 플랫폼을 측정해 놓고 그것을 자기 성과로 적었을 것입니다.

페이지 자체

무엇을 페이지에 담고 무엇을 빼는가?

페이지에 들어가야 할 것이 다섯, 적극적으로 해로운 것이 다섯입니다. 경계선은 그 항목이 패널을 돌리지 않은 사람의 추궁을 견디느냐입니다.

페이지에 담기

  • 엔진별 언급률과 인용률, 각각에 구간과 관측 수를 붙여서
  • 작업한 집합을 홀드아웃 세트 옆에 두어 드리프트와 효과가 한눈에 갈라지도록
  • 프롬프트 유형별 분해. 한 유형의 상승과 다른 유형의 하락은 합계에서 상쇄되므로
  • 패널 전체의 피인용 URL 순위표. 모든 경쟁사와 서드파티를 포함해서
  • 답변 원문 두세 개. 그중 최소 하나는 여러분을 틀리게 설명한 것

페이지에서 빼기

  • 엔진을 가로질러 평균 낸 단일 숫자
  • 최소 검출 가능 효과보다 작은 변동에 붙인 화살표
  • 예시가 아니라 증거로 내미는 스크린샷
  • 인용에 귀속시킨 추정 세션 수나 파이프라인
  • 내가 나오지 않았다는 이유로 조용히 버린 실행

두 항목은 이유를 말해 두어야 합니다. 틀린 답변 원문이 페이지에 들어가는 까닭은, 등장 여부를 재는 지표가 자신 있게 틀린 제품 설명을 승리로 계산하기 때문이고, 그 기저 발생률도 낮지 않기 때문입니다. 2025년 3월 6일 공개된 Tow Center for Digital Journalism의 감사는 여덟 개 엔진에 걸친 쿼리 1,600건을 조사해, 이들이 “쿼리의 60퍼센트 넘게 틀린 답을 내놓았다”고 보고했습니다.2 인용된 문장 하나가 어떤 차트보다 수정에 예산을 붙게 만듭니다.

매출 줄이 빠지는 까닭은 곱할 계수가 존재하지 않기 때문입니다. 이 분야 자신의 서베이는 인용 점수가 클릭, 전환, 매출을 예측한다는 주장을 확신도 매우 낮음으로 평가하고,1 Pew Research Center의 2025년 7월 브라우징 연구는 사용자가 AI 요약 안의 링크를 클릭한 방문이 약 1%였다고 밝혔습니다.3 경영진이 상업적 표현을 원한다면, 모델링 가정을 소리 내어 말하고 그것이 가정임을 명시하십시오. 차트가 되는 순간 그것은 측정 결과로 인용됩니다.

엔진별로

보고서는 왜 엔진을 가로질러 평균 낼 수 없는가?

엔진들이 같은 웹을 보고 있지 않기 때문입니다. SIGIR 2026 연구는 Google 자연 검색, AI Overviews, Gemini Flash 2.5가 쿼리 11,500건에 돌려준 출처를 비교해, URL 수준 Jaccard 유사도를 AI Overviews와 자연 검색결과 페이지 사이에서 0.18, 자연 검색과 Gemini 사이에서 0.16, 두 AI 서피스 사이에서 0.11로 측정했습니다. “어떤 쿼리 부분집합이든, 어떤 검색엔진 쌍을 비교하든, 검색된 목록은 서로 다르다. 세 가지 모두 Google이 개발했는데도 그렇다.”5 한 벤더에서 나온 세 서피스가 이미 서로 어긋납니다.

그러면 섞은 점수는 독자에게 필요한 것을 감춥니다. 한 엔진에서 41%, 다른 엔진에서 9%라면 평균 25%는 어느 쪽에도 참이 아닙니다. 그 값은 가중치를 바꿀 때 움직이지, 여러분의 가시성이 움직일 때 움직이지 않습니다. 2026년 비판적 서베이도 감사 문헌에서 같은 지점에 도달해, 상업용 엔진들에서 “출처 중복이 낮고, 실행 간 변동이 상당하며, 충실도 격차가 사라지지 않고 남아 있다”고 보고합니다.1

대신 작은 표를 내십시오. 엔진마다 한 줄씩, 각자의 관측 수와 구간과 패널 버전을 함께 둡니다. 경영진이 추적할 숫자 하나를 원한다면, 이름을 붙인 단일 엔진으로 정하고 왜 그 엔진이 사업적으로 중요한지 말하십시오.

주기

이 보고서는 실제로 얼마나 자주 내야 하는가?

숫자는 월간으로 공개하고 패널은 주간으로 돌리십시오. 둘은 다른 일이기 때문입니다. 엔진당 약 200건의 관측을 담은 주간 패널은 대략 13에서 14포인트의 움직임만 잡음과 구분할 수 있고, 같은 실행을 월간으로 합치면 그 기준이 약 6.6포인트까지 내려갑니다. 그리고 실제 변화는 거의 전부 이 두 숫자 사이에 떨어집니다.

주간 읽기는 정성적이고 정말로 쓸모가 있습니다. 비율이 아니라 답변을 읽고 세 가지를 찾으십시오. 인용 목록에 새로 나타난 경쟁사나 서드파티 URL, 지난주에는 없던 제품에 대한 거짓 진술, 그리고 AI 답변 자체를 더 이상 돌려주지 않게 된 프롬프트입니다. 각각은 비율이 아니라 사건이므로 통계적 검정력이 필요하지 않습니다. 기록하고 움직이십시오. 산수는 월간 페이지에 남겨 두십시오.

분기마다 사업과 견주어 패널을 다시 읽으십시오. 프롬프트는 낡습니다. 아무것도 폐기하지 않는 패널은 아무도 묻지 않는 질문을 서서히 측정하게 됩니다. 이것은 메이저 올림이자 기준선을 새로 잡는 일이므로 일정에 넣으십시오.

널 결과

아무것도 움직이지 않았을 때 보고서에는 무엇을 쓰는가?

“검출 가능한 변화 없음”이라고 쓰고, 검출할 수 있었을 변화의 크기를 함께 찍으십시오. “이 엔진 언급률 31%, 관측 200건, 지난달 29% 대비 검출 가능한 변화 없음. 이 패널이 검출할 수 있었던 가장 작은 변화는 약 13포인트”라고 쓰면, 무엇이 밝혀지고 무엇이 밝혀지지 않았는지 독자에게 정확히 전달됩니다. “2포인트 상승”은 거짓을 전달합니다.

널 결과가 치워지지 않도록 지켜 주는 습관이 둘 있습니다. 하나, 내가 나오지 않은 회차까지 포함해 모든 실행을 분모에 남기십시오. 2026년 비판적 서베이의 체크리스트가 그것을 요구하고, 빈 실행을 조용히 버리는 것은 패널이 그 주인인 팀에게 아첨하기 시작하는 가장 흔한 경로입니다.1 둘, 점추정이 아니라 구간을 보고하십시오. 2026년 3월의 AI 가시성 측정 통계 논문은 인용 횟수가 멱법칙 모양이고 순위가 “표본에 따라 불안정하며, 상위 도메인뿐 아니라 자주 인용되는 도메인 집합 전체에 걸쳐 그렇다”는 것을 발견했고, 그 불확실성을 부트스트랩 재표집으로 보고했습니다.4 비율이 매우 낮거나 매우 높은 구역에서는 정규 근사가 나빠지므로, 정확 구간이나 부트스트랩 구간이 정직한 계기입니다. 다만 이 단서는 평범한 통계이지 그 논문의 발견은 아닙니다.

널이 오히려 보통이라고 예상하십시오. NeurIPS 2025의 C-SEO Bench는 “현재의 C-SEO 방법 대부분은 대체로 효과가 없을 뿐 아니라 문서 순위에 부정적 영향을 주는 경우도 잦다”고 밝혔습니다.7 그렇더라도 평평한 달이 보고할 것이 없는 달인 경우는 드뭅니다. 비율이 움직이지 않아도 인용 목록은 바뀌어 있고, 행동은 바로 거기에 있습니다. 누구의 페이지가 누구를 밀어냈는지, 내 페이지 가운데 어느 것이 한 번도 나오지 않는지, 어떤 답변이 이제 나에 대해 사실이 아닌 말을 하는지입니다. 비율이 올라가야 가치가 생기는 보고서는, 결국 비율을 올리기 위해 쓰이게 됩니다.

이 글의 정직한 한계

여기 나온 홀드아웃 설계는 이 용도로 검증되지 않았고, 쉽게 검증할 수도 없습니다. 이중차분 비교는 여러분이 아무것도 하지 않았다면 두 집합이 나란히 드리프트했을 것이라고 가정하는데, AI 답변 엔진이 프롬프트 유형을 가로질러 나란히 드리프트하는지 검증한 발표 연구는 없습니다. 관련된 유일한 측정은 인용 횟수를 아흐레 연속으로 본 것이고, 공통 추세가 아니라 자주 인용되는 집합 전체의 불안정성을 발견했습니다. 그래서 홀드아웃은 플랫폼 전반에서 무언가가 일어났다는 것은 믿을 만하게 알려 주지만, 그 크기가 얼마인지는 알려 주지 않습니다. 뺄셈을 보정된 수치 하나로 발표하지 말고, 두 집합을 나란히 보여 주십시오. 여기 나머지는 발견이 아니라 규율입니다. 출처 표기는 보고서를 검증 가능하게 만들 뿐, 옳게 만들지는 않습니다.

제품이 쓸모 있는 자리와 그렇지 않은 자리

이 보고서의 정체는 스프레드시트 하나와 거기서 정직하겠다는 결정입니다. 프롬프트 목록에 버전을 매기고, 열두 개 남짓을 홀드아웃으로 표시해 절대 건드리지 않고, 모든 수치에 엔진과 관측 수와 날짜와 버전을 찍고, 실제로 그랬을 때는 “검출 가능한 변화 없음”이라고 쓰십시오. Bavior는 고정된 프롬프트 패널을 다섯 개 엔진에 정해진 일정으로 돌리고, 비어 있는 회차까지 포함해 모든 실행을 보관하고, 여러분의 것이 아닌 URL까지 포함해 인용된 URL을 모두 기록하며, 엔진별로 보고합니다. 하지 않는 일은 어떤 프롬프트가 여러분의 홀드아웃인지 정해 주는 것, 아무도 그것에 최적화하지 않도록 강제하는 것, 인용에서 트래픽이나 매출을 예측하는 것입니다. 무료 AI 가시성 체커무료 GEO 진단은 유료 플랜 없이 이용할 수 있습니다. 유료 플랜은 월간 결제 시 월 $99부터, 연간 결제 시 월 $79.17입니다(2026년 8월 30일 기준).

출처, 모두 2026년 8월 30일 확인
  1. “Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)”, 2026년 7월 15일, arXiv:2607.14035. 표 5와 표 6(서베이 프리프린트): arxiv.org/abs/2607.14035
  2. Jaźwińska & Chandrasekar, Tow Center for Digital Journalism, “AI Search Has a Citation Problem”, 2025년 3월 6일. 여덟 개 엔진에 걸친 쿼리 1,600건, 60% 넘게 오답: cjr.org
  3. Pew Research Center, 2025년 7월 22일. AI 요약 안의 출처를 클릭한 방문은 약 1%: pewresearch.org
  4. Sielinski, “Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement”, 2026년 3월, arXiv:2603.08924(프리프린트): arxiv.org/abs/2603.08924
  5. Grossman 외, “How Generative AI Disrupts Search”, SIGIR 2026. 쿼리 11,500건, Google 자연 검색결과와 AI Overviews와 Gemini 사이의 URL 수준 Jaccard 0.11–0.18: arxiv.org/abs/2604.27790
  6. AI Overview 인용 시계열. 2025년 7월에 표집한 인용 190만 건과 2026년 3월 키워드 결과 페이지 863,000개에 걸친 피인용 URL 400만 건의 비교. 피인용 페이지 가운데 자연 검색 상위 10위에도 들어 있던 비율은 약 76%에서 약 38%로 하락. 벤더 공개 자료이므로 이 커리큘럼의 출처 규칙에 따라 서술만 하고 링크하지 않습니다.
  7. Puerto 외, “C-SEO Bench: Does Conversational SEO Work?”, NeurIPS 2025 Datasets & Benchmarks Track, arXiv:2506.11097: arxiv.org/abs/2506.11097
FAQ

자주 묻는 질문입니다.

프롬프트 홀드아웃 세트는 얼마나 커야 하나요?

프롬프트 10~15개를, 패널 나머지의 유형 구성을 그대로 반영하도록 고릅니다. 개수보다 구성이 더 중요합니다. 실제로 작업하는 프롬프트의 3분의 1이 비교형 질문이라면 홀드아웃의 3분의 1도 그래야 합니다. 프롬프트 유형마다 드리프트 속도가 다르고, 정의형 질문만으로 만든 홀드아웃은 비교형 질문을 때린 변화를 따라가지 못하기 때문입니다. 패널을 만들 때 얼려 두고, 나머지 전부와 함께 버전을 매기고, 새로 온 팀원이 실수로 그것을 위한 콘텐츠를 쓰지 못할 만큼 분명하게 표시해 두십시오. 그 자체의 구간은 넓을 것이므로, 그 움직임은 정밀한 보정이 아니라 방향으로 읽으십시오.

패널에 버전 번호가 왜 필요한가요?

프롬프트를 하나 넣거나 빼면 페이지의 모든 비율의 분모가 바뀌므로, 서로 다른 패널 버전이 만들어 낸 두 수치는 똑같아 보여도 비교할 수 없기 때문입니다. 두 자리로 된 버전을 쓰십시오. 마이너 올림은 프롬프트가 묻는 내용을 바꾸지 않는 문구 수정이고, 이를 가로지른 비교는 각주가 있으면 괜찮습니다. 메이저 올림은 프롬프트를 추가하거나 제거하거나 범위를 바꾼 경우이고, 이때는 비교하지 말고 기준선을 다시 잡습니다. 버전은 모든 수치 옆에 찍고, 프롬프트 목록은 버전 관리에 두어 누구나 두 버전을 diff할 수 있게 하십시오. 측정하려는 작업을 내보내는 것과 같은 기간에는 절대로 패널을 바꾸지 마십시오.

AI 가시성 보고서에 추정 트래픽을 넣어야 하나요?

넣지 마십시오. 곱해야 할 계수가 측정된 적이 없기 때문입니다. 이 분야 자신의 2026년 서베이는 인용 점수가 클릭, 전환, 매출을 예측한다는 주장을 확신도 매우 낮음으로 평가하고, Pew Research Center의 2025년 7월 브라우징 연구는 사용자가 AI 요약 안의 출처를 클릭한 방문이 약 1%였다고 밝혔습니다. 경영진이 상업적 표현을 원한다면, 차트가 아니라 가정을 이름 붙인 한 문장으로 쓰십시오(“독자의 약 1%가 클릭하고 이 질문이 자주 나온다면”). 차트로 만들면 두 번째 회의쯤에는 측정 결과로 인용됩니다.

숫자가 움직이지 않았을 때 보고서에는 무엇을 쓰나요?

“검출 가능한 변화 없음”이라고 쓰고, 그 패널이 검출할 수 있었던 가장 작은 변화를 옆에 찍으십시오. “언급률 31%, 관측 200건, 지난달 29% 대비 검출 가능한 변화 없음. 검출 가능한 가장 작은 변화는 약 13포인트”라고 쓰면 무엇이 밝혀지고 무엇이 밝혀지지 않았는지 독자에게 정확히 전달되고, “2포인트 상승”은 거짓을 전달합니다. 그런 다음 실제로 바뀐 것을 보고하십시오. 비율이 움직이지 않는 달에도 인용 목록은 움직이고, 행동은 바로 거기에 있습니다. 누구의 페이지가 누구를 밀어냈는지, 내 페이지 가운데 어느 것이 한 번도 나오지 않는지, 어떤 답변이 이제 나에 대해 사실이 아닌 말을 하는지입니다.

Bavior 편집팀

Reddit 마케팅과 AI 검색 가시성에 관한 Bavior의 콘텐츠를 조사하고 관리하는 팀입니다. 본문의 모든 수치에는 출처와 확인 날짜를 명시했으며, 제휴 링크는 사용하지 않습니다.

수치에 오류를 발견하셨나요? 알려주시면 다시 확인하겠습니다: support@bavior.com

모든 수치에 출처를 찍으십시오.
그래야 방어할 수 있습니다.

무료 체험 시작