/GEO 배우기/통계적 검정력
AI 가시성 측정 · 계산

전후 비교에는 통계적 검정력이 얼마나 필요한가?

여러분의 전후 비교가 의미가 있는지는 공식 하나가 결정합니다. 그리고 그 공식은 손으로 확인할 수 있을 만큼 짧습니다. 이 페이지의 모든 숫자가 거기서 나옵니다. 주간 보고서에 관한 불편한 결론까지 포함해서입니다.

이 페이지의 내용
이 글 공유하기
X에 공유 LinkedIn에 공유
짧은 답

전후 비교에는 여러분이 실제로 행동에 옮길 최소 변화를 검출할 만큼의 관측이 필요하고, 그 수는 두 비율 표본 크기 공식이 알려 줍니다. n = (1.96 + 0.84)² × [p₁(1−p₁) + p₂(1−p₂)] ÷ δ², 검정력 80%, 양측 5% 유의수준입니다. 30% 베이스라인에서 10포인트 변화는 기간당 약 353건, 2포인트는 8,400건입니다. 그래서 엔진당 관측 200건짜리 주간 보고서가 가려낼 수 있는 것은 대략 13에서 14포인트까지이고, 그보다 작은 것은 가려내지 못합니다. 검정력 부족은 발표된 연구의 정상 상태입니다. 2013년의 한 리뷰는 연구 730건을 포함한 메타분석 49건을 대상으로 통계적 검정력의 중앙값을 21%로 제시했습니다.10

핵심 요약
  • 세는 것은 관측 수이지 프롬프트 개수가 아닙니다. 관측 1건은 프롬프트 하나를 엔진 하나에서 한 번 실행한 것입니다. 그래서 프롬프트 60개를 여섯 번 실행하면 360건입니다.
  • 필요량은 제곱으로 커집니다. 검출하려는 변화를 절반으로 줄이면 데이터는 네 배가 됩니다. “관측 수 ≈ 3.5 ÷ δ²”면 회의 자리에서 확인할 만큼은 맞습니다.
  • 주간 수치는 솔직히 말해 추세 화살표를 지탱하지 못합니다. 공개는 월 단위로 하고, 패널이 안정적이면 짝을 지어 설계하고, 절대 손대지 않는 프롬프트를 남겨 두십시오. 그래야 엔진 드리프트가 여러분의 효과로 읽히지 않습니다.
공식

전후 비교의 표본 크기 공식은 무엇인가?

두 비율을 비교할 때는 평범한 두 비율 공식을 씁니다. 이 페이지의 모든 수치가 거기서 나옵니다. n = (zα/2 + zβ)² × [p₁(1−p₁) + p₂(1−p₂)] ÷ (p₂ − p₁)². 관례적인 설정, 즉 양측 5% 유의수준이라 zα/2 = 1.96, 검정력 80%라 zβ = 0.84로 두면 앞의 상수는 2.8² = 7.84입니다.

각 항은 데이터를 모으기 전에 여러분이 정하는 값입니다. p₁은 출발점 비율이고, 추측이 아니라 실측합니다. p₂는 검출할 수 있기를 바라는 비율이며, 이것은 비즈니스 판단입니다. 다음 분기에 무엇에 돈을 쓸지를 바꿀 만한 최소 개선 폭입니다. δ = p₂ − p₁는 그 차이이고 소수로 씁니다. 그리고 n은 각 기간의 관측 수이며, 관측 1건은 프롬프트 하나를 엔진 하나에서 한 번 실행한 것입니다.

한 줄만 손으로 계산해 두면 나머지는 검산할 수 있습니다. 30%에서 40%로: 0.30 × 0.70 = 0.21, 여기에 0.40 × 0.60 = 0.24를 더해 합이 0.45, 7.84를 곱하면 3.528, δ² = 0.01로 나누면 352.8입니다. 즉 전에 관측 353건, 후에 353건입니다.

이 가운데 AI 검색에만 해당하는 것은 하나도 없습니다. 이진 결과를 비교할 때의 산술 그 자체이고, 위의 판본은 유통되는 둘 중 작은 쪽입니다. 대부분의 계산기가 돌리는 것은 Casagrande, Pike, Smith의 연속성 보정 공식이며, 그쪽이 더 큰 n을 돌려줍니다. 그러니 이 페이지의 모든 수치를 하한으로 읽으십시오.6 한 비율의 정밀도와 두 비율 차이의 검출은 다른 계산입니다. 앞쪽에 맞춰 크기를 정한 패널은 뒤쪽에는 으레 너무 작습니다. 정밀도에 맞춘 크기 산정은 프롬프트 리서치의 패널 규모에서 다룹니다.

수치

변화 크기마다 관측이 몇 건 필요한가?

30% 시작 비율에서, 엔진당. 20포인트 변화면 기간당 관측 약 91건, 10포인트면 353건, 5포인트면 1,372건, 2포인트면 8,400건입니다. 가운데 열은 분산 항입니다.

검출할 변화p₁(1−p₁) + p₂(1−p₂)기간당 관측 수그것을 채우는 패널
30% → 50%(20포인트)0.460약 91프롬프트 20개 × 5회
30% → 40%(10포인트)0.450약 353프롬프트 60개 × 6회
30% → 35%(5포인트)0.438약 1,372프롬프트 60개 × 23회, 주간으로는 불가
30% → 32%(2포인트)0.428약 8,400제정신인 주기로는 달성 불가

개별 행보다 더 중요한 성질이 두 가지 있습니다. 첫째, 필요량은 δ에 대해 제곱으로 커지므로 검출하려는 효과를 절반으로 줄이면 데이터는 네 배가 됩니다. 첫 행과 마지막 행 사이의 18포인트가 약 90배라는 대가가 되는 이유이고, 이것이 프로그램이 감당할 수 있는 보고 주기를 결정합니다.

둘째, 분산 항은 거의 움직이지 않습니다. 표 전체에서 0.428에서 0.460 사이일 뿐이라, 변동의 거의 전부가 δ 하나에서 옵니다. 덕분에 이 범위에서 오차 5% 안쪽으로 맞는 지름길이 생깁니다. 관측 수 ≈ 3.5 ÷ δ², δ는 소수입니다.

결과

관측 200건짜리 주간 보고서는 무엇을 검출할 수 있나?

엔진당 관측 200건을 담은 주간 보고서가 검출할 수 있는 것은 대략 13에서 14포인트의 변화입니다. 지름길을 거꾸로 돌려 봅니다. 3.5 ÷ 200 = 0.0175, 그 제곱근은 0.132입니다. 30% 베이스라인에서 정확한 공식으로 풀면 약 13.5포인트입니다. 30%에서 44%로의 상승은 검출 가능한 가장자리에 걸쳐 있고, 30%에서 35%로의 상승은 보이지 않습니다. 대시보드가 아무리 자신 있게 그려도 그렇습니다.

따라 나오는 결론은 불편합니다. 주간 GEO 보고서는 솔직히 말해 큰 변동 말고는 아무것도 검출하지 못합니다. 그보다 작은 것은 모두 요동입니다. 그것을 진전으로 보고하는 것이, 넉 달째에 아무도 이유를 대지 못한 채 선이 되돌아갈 때 프로그램이 신뢰를 잃는 방식입니다.

같은 산술이 발표된 사례 연구를 읽는 법도 알려 줍니다. 표본 크기를 손에 쥐고 읽는 것입니다. 생성형 엔진 최적화에서 가장 유명한 주장, 즉 GEO가 가시성을 40% 높인다는 2026년 비판적 서베이에 일반적 주장으로는 기각으로 올라 있습니다. 그 수치가 최초 논문에서 “특정 구성에서 한 지표에 대한 상대적 최댓값”이고, 그 논문이 측정한 것은 실제 엔진 위의 가시성이 아니라 고정된 맥락 안의 위치 가중 지표였기 때문입니다.24 대부분의 사례는 더 조용히 실패합니다. 누군가 재작성 뒤 가시성이 22%에서 27%로 올랐다고 보고하면, 각 수치 뒤에 관측이 몇 건 있는지 물어보십시오. 한쪽당 약 1,400건 아래에서는 그 비교가 효과와 노이즈를 갈라내지 못합니다. 이것은 부정직한 것이 아니라 검정력 부족이며, 우리가 발표하는 것에도 똑같이 적용됩니다.

M형 오류와 S형 오류

검정력이 부족한 검정의 유의한 결과는 무엇을 과장하는가?

과장되는 것은 그 검정 자신의 효과 크기이고, 그 배수는 미리 계산할 수 있습니다. 검정력이 낮으면 유의성 문턱을 넘을 만큼 큰 것은 지나치게 크게 나온 추정치뿐입니다. 그래서 유의성으로 거르는 일 자체가 과장을 골라내는 일이 됩니다. Gelman과 Carlin은 이 왜곡을 과장비라 부르고 “효과의 크기가 얼마나 과대평가될 수 있는지의 배수”로 정의하며, 유의한 추정치의 부호가 반대일 확률인 S형 오류와 짝지었습니다.9

실무에서의 모습은 이렇습니다. 13포인트를 검출할 만큼의 검정력밖에 없는 비교가, 참 효과가 4포인트인데도 어쩌다 유의한 결과를 내놓는 경우에는 4보다 훨씬 큰 수치를 보고합니다. 이것은 검정의 결함이 아닙니다. 잡음이 많은 추정치에 유의성 필터를 걸면 벌어지는 일일 뿐이고, GEO 프로그램의 첫 분기에 아무도 재현하지 못하는 숫자가 그토록 자주 나오는 이유이기도 합니다.

이것은 예외적인 사례가 아니라 발표된 연구의 정상 상태입니다. 이 논점을 세운 2013년 리뷰는 연구 730건을 포함한 신경과학 메타분석 49건 전체의 통계적 검정력 중앙값을 21%로 제시했습니다.10 AI 가시성 사례 연구에 대한 동등한 감사는 없고, 대부분이 한 번만 실행한 것이므로 그보다 낮다고 가정하십시오. 방어책은 더 영리한 검정이 아닙니다. 데이터를 보기 전에 여러분이 행동에 옮길 효과 크기를 못 박고, 첫 유의한 결과는 발표할 발견이 아니라 다시 돌려 볼 가설로 다루는 것입니다.

세 가지 레버

실행을 늘리지 않고 검정력을 사려면?

일정에 실행을 한 번도 더하지 않고 비교가 검출할 수 있는 폭을 올리는 레버가 셋 있습니다. 기간을 늘리기, 프롬프트 유형 안에서 묶기, 짝을 지어 설계하기입니다. 이들은 패널이 아니라 비교 자체에 작용하므로, 프롬프트 리서치의 “프롬프트 개수 대 실행 횟수” 배분과 겹쳐 쓸 수 있습니다.

기간을 늘리십시오. 월간 비교는 이미 돌리고 있던 4주치 실행을 합칩니다. 그래서 관측 200건이 800건이 되고, 검출 가능한 효과는 약 13.5포인트에서 약 6.6포인트로 내려갑니다. 환율에 주의하십시오. 데이터가 네 배여도 사는 것은 두 배의 해상도뿐입니다. 필요량이 제곱으로 커지기 때문입니다. 인내만으로는 주간 주기를 구할 수 없습니다. 주간은 보고 단위로는 버리고 운영 점검으로만 남겨야 합니다.

프롬프트 유형 안에서 묶으십시오. 단일 프롬프트가 아니라 유형 하나를 통째로 전후 비교하십시오. 콘텐츠 변경은 어차피 유형 수준에서 드러나야 하기 때문입니다. 지켜야 할 규율은 같은 유형 안에서만 묶고 유형을 가로질러 묶지 않는 것입니다. 유형들은 서로 독립적으로 움직이므로, 12포인트 오른 유형을 변화 없는 네 유형과 섞으면 진짜 효과가 검출 불가능한 수준까지 희석됩니다. 그렇게 묶는 것은 검정력을 사는 것이 아니라 잃는 것입니다. 엔진을 가로질러 묶는 것은 더 나쁩니다. 엔진들이 리트리벌하는 출처는 거의 겹치지 않기 때문입니다.3

짝을 지어 설계하십시오. 전과 후에 동일한 패널을 실행하고 McNemar 검정으로 프롬프트마다 비교합니다. 이 검정은 상태가 바뀐 프롬프트만 쓰기 때문에 프롬프트 사이의 분산이 비교에서 빠집니다. 필요한 쌍의 수는 Connor의 공식이 줍니다. [1.96√ψ + 0.84√(ψ − δ²)]² ÷ δ², 여기서 ψ는 뒤집히는 프롬프트의 비중입니다.7 20%가 뒤집히는 상황에서 10포인트의 순변화를 검출하려면 프롬프트 쌍 약 155개, 관측으로는 310건이 필요하고, 짝을 짓지 않은 설계라면 706건입니다. 이 절약은 안정성에서 옵니다. 답변이 가장 덜 움직이는 엔진에서 가장 크고, 실행마다 크게 다시 굴려지는 엔진에서 가장 작습니다. 자세한 것은 AI 답변이 달라지는 이유를 보십시오.

어디서 무너지는가

이 계산은 언제 성립하지 않게 되는가?

이 공식 아래에는 가정이 셋 깔려 있고, AI 가시성 측정은 그 셋을 모두 수치가 좋아 보이는 쪽으로 어깁니다. 첫째는 정규 근사이고, 0이나 1에 가까운 비율에서는 불안정합니다. Brown, Cai, DasGupta는 거기서 커버리지가 나쁘고 n이 커져도 매끄럽게 좋아지지 않는다는 것을 보였습니다.8 답변의 4%에서만 이름이 불린다면 이 공식이 제시하는 표본 크기는 낙관적입니다. Wilson 구간이나 부트스트랩 구간을 쓰십시오. 2026년 3월의 AI 가시성 측정 통계 논의도, 인용 수가 멱법칙 형태이고 자주 인용되는 집합 전체에서 순위가 불안정하다는 것을 확인한 뒤 그렇게 권고합니다.1

둘째는 독립성입니다. 몇 분 사이에 한 묶음으로 쏜 실행은 새로운 추출이 아닙니다. 같은 색인 상태, 같은 캐시, 같은 모델 체크포인트를 만납니다. 그러니 실행을 기간 전체에 흩뿌리십시오. 실행이 시간적으로 군집을 이루면 언제나 유효 표본 크기는 명목보다 작아집니다. 그리고 AI 가시성 패널에 대한 설계 효과 추정치는 존재하지 않으므로, 얼마나 작은지는 아무도 말해 줄 수 없습니다.

셋째는 두 번의 측정 사이에 엔진이 바뀌지 않았다는 것입니다. 이것은 일상적으로 깨지고, 결과가 가장 큰 항목이기도 합니다. 이것이 무너지면 여러분이 측정한 것은 여러분의 작업이 아니라 플랫폼입니다. 2025년 7월 중순부터 10월 중순까지 수집된, 프롬프트 230,000건과 1억 건이 넘는 인용을 다룬 3개월짜리 상업 연구는, 어떤 어시스턴트의 어떤 대형 토론 플랫폼에 대한 인용률이 6주 만에 응답의 약 60%에서 약 10%로 떨어진 것을 기록했습니다.5 2026년 비판적 서베이는 “상업용 엔진들은 서로 다르며 시간에 따라 변한다”를 높음 확신도로 평가합니다.2 방어책은 여러분이 절대 손대지 않는 프롬프트 홀드아웃 세트입니다. 그래야 플랫폼 드리프트가 여러분의 효과와 따로 드러납니다. 만드는 법은 방어 가능한 보고서에서 다룹니다.

이 글의 정직한 한계

여기 있는 모든 숫자는 추정치가 아니라 하한입니다. 이 공식은 멈춰 있는 시스템에서의 독립 추출을 가정하지만, AI 답변 엔진은 둘 다 제공하지 않습니다. 하루 안의 실행들은 서로 상관되고, 엔진은 측정 아래에서 예고 없이 바뀝니다. 두 위반 모두 같은 방향으로 밀기 때문에 진짜 필요량은 표가 말하는 것보다 큽니다. 그리고 얼마나 큰지는 아무도 말할 수 없습니다. 프롬프트 패널에 대한 설계 효과 추정치가 존재하지 않기 때문입니다. 10포인트 변화에 관측 353건이라는 수치를 하한으로 다루고, 그보다 작은 수치를 대는 사람은 우리 자신을 포함해 의심하십시오.

제품이 쓸모 있는 자리와 그렇지 않은 자리

계산 전체는 곱셈 네 번과 나눗셈 한 번이고, 스프레드시트로 됩니다. 테스트 크기를 정하는 데 소프트웨어는 필요 없고, 이미 너무 작은 테스트의 검정력을 올려 줄 소프트웨어도 없습니다. Bavior는 고정된 프롬프트 패널을 다섯 개 엔진에 정해진 일정으로 돌리고, 아무 일도 없었던 회차까지 포함해 모든 실행을 기록합니다. 그것이 이 계산이 쓰는 원료입니다. 하지 않는 일은 유의성 검정을 돌리는 것, 여러분의 홀드아웃 세트를 정하는 것, 인용에서 트래픽이나 매출을 예측하는 것입니다. 이 분야 자신의 서베이는 마지막 연결을 매우 낮은 확신도로 평가합니다.2 무료 AI 가시성 체커무료 GEO 진단은 유료 플랜 없이 이용할 수 있습니다. 유료 플랜은 월간 결제 시 월 $99부터, 연간 결제 시 월 $79.17입니다(2026년 8월 29일 기준).

출처, 모두 2026년 8월 30일 확인
  1. Sielinski, “Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement”, 2026년 3월, arXiv:2603.08924(프리프린트). 인용 점유율 추정에는 부트스트랩 구간을 권고: arxiv.org/abs/2603.08924
  2. “Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)”, 2026년 7월 15일, arXiv:2607.14035(서베이 프리프린트). 일반적 주장으로 기각된 항목과 높음으로 평가된 “상업용 엔진들은 서로 다르며 시간에 따라 변한다”가 담긴 확신도 표: arxiv.org/abs/2607.14035
  3. Grossman 등, “How Generative AI Disrupts Search”, SIGIR 2026, arXiv:2604.27790. 쿼리 11,500건. 논문 본문은 Google 자연 검색 결과, AI Overviews, Gemini의 출처들 사이 Jaccard 유사도를 “0.11에서 0.18 사이”로 보고하고, 초록에서는 0.2 미만으로 요약합니다: arxiv.org/abs/2604.27790
  4. Aggarwal 등, “GEO: Generative Engine Optimization”, KDD ’24. 40%라는 수치의 출처이며, 고정된 맥락 안의 위치 가중 지표에 대한 상대적 최댓값입니다: arxiv.org/abs/2311.09735
  5. 2025년 11월 10일 공개된 인용 연구. 프롬프트 230,000건과 1억 건이 넘는 인용, 2025년 7월 14일부터 10월 12일까지 수집. 어떤 어시스턴트의 어떤 대형 토론 플랫폼에 대한 인용률이 6주 만에 응답의 약 60%에서 약 10%로 하락. 벤더가 공개한 자료라 이 커리큘럼의 규칙에 따라 링크하지 않고 서술만 합니다.
  6. Casagrande, Pike, Smith, “An Improved Approximate Formula for Calculating Sample Sizes for Comparing Two Binomial Distributions”, Biometrics 34(3):483, 1978. 연속성 보정 판본: doi.org/10.2307/2530613
  7. Connor, “Sample Size for Testing Differences in Proportions for the Paired-Sample Design”, Biometrics 43(1):207, 1987. 대응 설계 공식: doi.org/10.2307/2531961
  8. Brown, Cai, DasGupta, “Interval Estimation for a Binomial Proportion”, Statistical Science 16(2), 2001. 커버리지는 0과 1 근처에서 불안정: doi.org/10.1214/ss/1009213286
  9. Gelman, Carlin, “Beyond Power Calculations: Assessing Type S (Sign) and Type M (Magnitude) Errors”, Perspectives on Psychological Science 9(6):641–651, 2014. 과장비: doi.org/10.1177/1745691614551642
  10. Button 등, “Power failure: why small sample size undermines the reliability of neuroscience”, Nature Reviews Neuroscience 14(5):365–376, 2013. 메타분석 49건, 연구 730건 전체의 검정력 중앙값 21%: doi.org/10.1038/nrn3475
FAQ

자주 묻는 질문입니다.

제 GEO 작업이 효과가 있었다는 것을 증명하려면 관측이 몇 건 필요합니까?

증명하려는 차이가 얼마나 큰지에 전적으로 달렸고, 그 관계는 제곱입니다. 30% 시작 비율에서 20포인트 변화를 검출하려면 기간당 약 91건, 10포인트는 약 353건, 5포인트는 약 1,372건, 2포인트는 약 8,400건이 필요합니다. 모두 엔진당이고 검정력 80%, 양측 5% 유의수준 기준입니다. 관측 1건은 프롬프트 하나를 엔진 하나에서 한 번 실행한 것이므로, 프롬프트 60개를 여섯 번 실행하면 360건입니다. 먼저 어느 정도의 변화라야 예산 결정을 바꾸는지 정하고, 그 크기에 맞춰 테스트 크기를 잡으십시오. 데이터를 모아 놓고 나중에 이것으로 무엇을 말할 수 있는지 묻는 순서가 아닙니다.

AI 가시성을 그냥 주간으로 보고하면서 노이즈가 많다고 적어 두면 안 됩니까?

운영 점검으로 주간 보고하는 것은 괜찮지만, 거기에 추세 화살표를 그리면 안 됩니다. 엔진당 주 약 200건의 관측에서는 30% 베이스라인 기준으로 노이즈와 구분되는 최소 변화가 대략 13에서 14포인트입니다. 그래서 여러분이 보게 될 전주 대비 움직임은 거의 전부가 요동입니다. 현실적인 배치는 주간으로 실행하고, 주간으로 답변을 읽어 새로 등장한 경쟁사나 제품에 관한 새로운 잘못된 서술 같은 정성 신호를 잡고, 수치는 월간으로 공개하는 것입니다. 같은 실행을 4주치 모으면 검출 가능한 효과가 약 6.6포인트까지 내려갑니다.

짝을 지은 전후 설계는 정말로 데이터가 덜 듭니까?

그렇습니다. 게다가 패널이 안정적이면 절약 폭이 큽니다. 대응 설계는 전과 후에 동일한 프롬프트를 실행하고 McNemar 검정으로 프롬프트마다 비교하는데, 이 검정은 상태가 바뀐 프롬프트만 세기 때문에 프롬프트 사이의 분산이 비교에서 빠집니다. 두 측정 사이에 프롬프트의 20%가 뒤집히는 상황에서 10포인트의 순변화를 검출하려면 프롬프트 쌍 약 155개, 관측으로 모두 310건이 필요하고, 짝을 짓지 않은 설계라면 706건입니다. 이 절약은 안정성에서 오므로 실행 사이에 답변이 크게 다시 굴려지는 엔진에서는 줄어들고, 두 측정 사이에 프롬프트 목록을 바꾸면 완전히 사라집니다.

저희 비율은 4%입니다. 이 공식이 여전히 적용됩니까?

믿을 만하게는 아닙니다. 0이나 1 근처에서는 그 뒤에 있는 정규 근사가 불안정하고 커버리지가 나쁘며, 제시되는 표본 크기는 낙관적입니다. 그런 비율에서는 대신 Wilson 구간이나 부트스트랩을 쓰십시오. 2026년 3월의 AI 가시성 측정 통계 논의도, 인용 수가 멱법칙 형태이고 자주 인용되는 집합 전체에서 순위가 불안정하다는 것을 확인한 뒤 그렇게 권고합니다. 4%에 있는 브랜드에게 실질적인 결과는 주 단위로는 거의 아무것도 검출되지 않는다는 것입니다. 정직한 보고서는 그렇게 작은 분모 위에서 퍼센트 변화를 보여 주는 대신, 그 사실을 그대로 적습니다.

Bavior 편집팀

Reddit 마케팅과 AI 검색 가시성에 관한 Bavior의 콘텐츠를 조사하고 관리하는 팀입니다. 본문의 모든 수치에는 출처와 확인 날짜를 명시했으며, 제휴 링크는 사용하지 않습니다.

수치에 오류를 발견하셨나요? 알려주시면 다시 확인하겠습니다: support@bavior.com

테스트 크기를 먼저 정하고 돌리십시오.
그래야 숫자에 의미가 생깁니다.

무료 체험 시작