/GEO 배우기/패널 규모
프롬프트 리서치 · 표본 크기

프롬프트 패널은 얼마나 커야 하고, 각각 몇 번 돌려야 하나?

답변에 등장하느냐는 편향을 모르는 동전 던지기입니다. 그래서 이 문제 전체는 평범한 비율 산수입니다. 써 놓고 보면, 이 분야가 숫자를 보고하는 방식에 대해 불편한 두 가지를 말합니다.

이 페이지의 내용
이 글 공유하기
X에 공유 LinkedIn에 공유
짧은 답

엔진별, 기간별로 프롬프트 약 40개를 각각 5회씩 돌리는 것이 공개할 만한 숫자를 내놓는 가장 작은 패널입니다. 관측 200건, 등장률 50%에서 95% Wilson 구간이 대략 ±7포인트입니다. 프롬프트 하나를 한 번 돌리면 구간이 ±45포인트, 다섯 번 돌리면 약 ±33이므로, 보고 단위는 패널이지 개별 프롬프트가 아닙니다. 이 분야의 비판적 서베이는 표본 추출을 통제할 수 있는 서피스에서 실행을 반복하면 판정의 9%에서 28%가 바뀐다고 기록합니다. 한 번의 실행이 감추는 것이 바로 이 변동입니다.2

핵심 요약
  • 세는 것은 관측이지 프롬프트 개수가 아닙니다. 관측 한 건은 프롬프트 하나를 엔진 하나에서 한 번 돌린 것이므로, n은 프롬프트 수 곱하기 실행 횟수이며 엔진마다 따로 셉니다.
  • 싸게 사는 쪽은 프롬프트당 약 다섯 번까지의 실행이고, 그다음이 프롬프트입니다. 엔진별, 기간별로 관측 약 600건을 넘어서면 추가로 얻은 정밀도는 엔진 자체의 드리프트가 지웁니다.
  • 여기 나오는 구간은 모두 하한입니다. 한 프롬프트의 실행들은 군집을 이루는데, 그것을 보정할 상관계수를 공개한 사람이 아무도 없기 때문입니다. 패널 등장률은 n과 엔진과 날짜를 붙여서 공개하십시오.
공식

등장률 뒤에 있는 산수는 무엇인가

등장률은 표본 비율입니다. 모든 실행은 당신 이름을 부르거나 부르지 않거나 둘 중 하나입니다. 각 실행은 관측할 수 없는 확률 p를 가진 베르누이 시행이고, 그 p는 한 엔진 위의 한 프롬프트의 한 주에 속합니다. 당신이 보는 것은 당신 이름을 부른 실행의 비율뿐입니다. 이 페이지의 모든 구간은 95% Wilson 점수 구간이며, Brown, Cai, DasGupta가 교과서적 정규근사 대신 권장하는 것입니다.11 50% 비율에서 그 반폭은 1.96을 “(n + 3.84)의 제곱근의 2배”로 나눈 값입니다. 여기서 n은 그 숫자 뒤에 있는 관측 수입니다.

두 가지 관례가 있어서, 데이터가 하나도 없을 때부터 쓸 수 있습니다. p = 0.5에서 계산하십시오. p(1−p)가 거기서 최대가 되므로, 최악의 경우로 계획하면 약속한 구간이 실제로 얻은 구간보다 좁아지는 일이 없습니다. 그리고 프롬프트가 아니라 관측을 세십시오. n은 프롬프트 수 곱하기 실행 횟수이며, 엔진마다 따로입니다.

거꾸로 풀면 패널 규모가 바로 나옵니다. 반폭 w에 이르려면 n = 0.96/w² − 3.84건의 관측이 필요합니다. ±10포인트면 약 92건, ±7이면 192건, ±5면 380건입니다. 이 페이지의 n은 모두 연구 결과가 아니라 이 산수의 결과이므로 논문 각주가 붙지 않습니다. 아래 출처는 이 산수가 어디서 깨지는지, 그 아래에서 엔진이 얼마나 움직이는지를 위한 것입니다.

구간

표본 크기마다 구간은 얼마나 넓은가

아래 각 행은 엔진 하나, 기간 하나에 대해 같은 공식을 서로 다른 n에서 계산한 값입니다.

그 숫자 뒤에 있는 관측n등장률 50%에서의 95% Wilson 구간정직하게 말할 수 있는 것
프롬프트 1개를 1회 실행1±45포인트아무것도 말할 수 없습니다. 이건 일화입니다
프롬프트 1개를 5회 실행5±33포인트그 프롬프트 자체에 대해서는 아무것도
프롬프트 1개를 30회 실행30±17포인트프롬프트 단위의 큰 움직임만
프롬프트 40개 × 1회40±15포인트거친 첫 베이스라인
프롬프트 40개 × 5회200±7포인트패널 등장률, 엔진별, 기간별
프롬프트 80개 × 5회400±5포인트구간이 더 좁은 패널 등장률
프롬프트 60개 × 10회600±4포인트패널 등장률에 유형별 분해까지
프롬프트 60개 × 20회1,200±2.8포인트엔진이 가만히 있어 주지 않는 정밀도

앞의 네 행은 대시보드에 대한 경고로 읽으십시오. 프롬프트별 점수에 전주 대비 화살표를 붙이는 것이 대부분 가시성 보고의 기본 출력인데, 다섯 번 실행에서 그 화살표는 ±33포인트짜리 구간 안에 그려집니다. 아래에서 아무것도 바뀌지 않아도 화살표는 어느 쪽으로든 향할 수 있고, 그 프롬프트 하나를 서른 번 돌려도 ±17이 남습니다.

마지막 행은 예산 천장으로 읽으십시오. 관측을 600건에서 1,200건으로 두 배 늘려서 사는 것은 반폭 1.2포인트이고, 이는 이 시스템들이 한 주와 다음 주 사이에 스스로 움직이는 폭보다 작습니다. 이 분야의 비판적 서베이는 날마다의 출처 겹침을 대략 Jaccard 0.34에서 0.42로 놓고, 24시간 안의 재실행도 비슷한 수준이라고 하면서 결론을 분명히 말합니다. 가시성은 분포이며, “점추정은 안정적인 지표가 아니다”라고.2

보고 단위

왜 보고 단위는 패널이고 프롬프트가 아닌가

패널이 보고 단위인 이유는, 쓸 만한 구간을 감당할 만큼의 관측을 뒤에 둔, 이 설계에서 가장 작은 대상이기 때문입니다. 현실적인 실행 횟수의 프롬프트 하나는 누구든 검출하려는 효과보다 몇 배 넓은 구간을 안고 있습니다. 그래서 프롬프트별 숫자는 작은 측정이 아니라, 측정이 아닙니다. 공개할 문장은 이렇게 읽힙니다. 패널 전체에서 답변의 34%에 이름이 등장, ±7, 엔진 하나에서 프롬프트 40개를 5회씩, 8월 24일 주간, 패널 버전 3.

개별 프롬프트는 지표가 아니라 전시물로서 자리를 얻습니다. 프롬프트 하나의 답변 본문은 패널 등장률이 그 값인지를 말해 주는 유일한 것이고, 기간마다 몇 개를 손으로 읽는 것이 잘못된 서술을 잡아내는 방법입니다. Tow 센터가 엔진 여덟 개에서 쿼리 1,600건을 감사한 결과, 이 도구들은 그중 60%가 넘는 쿼리에 틀린 답을 내놓았습니다. 등장 플래그는 그것을 승리로 기록합니다.7

엔진을 합치는 일도 결코 없습니다. SIGIR 2026의 쿼리 11,500건 연구는 한 회사가 가진 세 답변 서피스 사이의 URL 수준 Jaccard 유사도를 0.11에서 0.18로 측정했고,3 그보다 앞선 단계별 응답 672건 감사는 고유 도메인 355개 중 시험한 두 시스템 모두가 인용한 것은 26%뿐임을 발견했습니다.4 엔진을 섞은 통합 등장률은 거의 겹치지 않는 모집단을 평균 내는 일이고, 이 지표가 존재하는 유일한 질문, 즉 다음에 어느 엔진을 붙잡을 것인가에 답하지 못합니다. 패널은 검색 순위의 대리 지표도 아닙니다. 2025년 9월에 발행된 4,706개 쿼리 AI Overviews 감사에서 참조된 도메인의 53%가 오가닉 상위 10위 밖에 있었고,5 2026년 봄 55,393개 쿼리 연구에서는 인용된 도메인의 29.8%가 첫 페이지 전체에 없었습니다.6

배분

프롬프트를 더 살 것인가, 실행을 더 살 것인가

실행을 먼저 사되 프롬프트당 약 다섯 번까지, 그다음 프롬프트를 사고, 엔진별 기간별 관측 약 600건에서 멈추십시오. 총량이 고정되면 구간은 어느 쪽이든 동일합니다. n은 그저 프롬프트 수 곱하기 실행 횟수이기 때문입니다. 그래서 문제는 각 지출이 구간 말고 무엇을 사 주느냐입니다. 실행은 이미 묻기로 정한 질문에 대한 정밀도를 삽니다. 프롬프트는 잘못 골랐을지도 모르는 질문에 대한 커버리지를 사는데, 이것이 초기에는 더 큰 위험이고 나중에는 더 작은 위험입니다.

실행이 먼저인 이유는 처음 몇 번이 유난히 싸기 때문입니다. 프롬프트 40개짜리 패널을 1회에서 5회로 올리면 구간이 ±15에서 ±7이 되고, 추가 수집은 160건입니다. 각각 5회씩인 상태에서 프롬프트를 40개에서 80개로 늘리면 ±7에서 ±5로만 가고, 200건이 듭니다. 다섯 번을 넘으면 곡선이 평평해지고, 프롬프트를 더 늘릴 근거는 지금 전혀 보지 못하는 의도를 측정한다는 근거로 바뀝니다. 그것은 여섯 가지 프롬프트 유형의 몫입니다.

천장을 정하는 것은 산수가 아니라 엔진입니다. 2025년 7월 14일부터 10월 12일까지 프롬프트 230,000개와 1억 건이 넘는 인용을 다룬 한 벤더의 시계열은, 큰 포럼 도메인 하나의 어떤 어시스턴트에서의 인용률이 8월 초에서 9월 중순 사이에 응답의 약 60%에서 약 10%로 떨어진 것을 기록했습니다.9 동료 평가가 아니라 벤더가 공개한 자료지만, 서베이는 “상용 엔진들은 서로 다르고 시간에 따라 변한다”를 높은 확신도로 평가합니다.2

비용을 구체적으로. 프롬프트 40개를 5회씩 엔진 5개에 돌리면 주당 수집 1,000건이고, 60개를 10회씩이면 3,000건입니다. 읽는 비용도 고르지 않습니다. 지금까지 유일한 학술 인용 분류 연구는 어시스턴트 세 개에서 프롬프트당 평균 인용 수를 6.88, 12.06, 16.35로 측정했습니다.8

문헌

공개 연구는 실행 횟수를 권고하는가

합니다. 그리고 공개된 유일한 제안은 다섯보다 높습니다. 2026년 비판적 서베이는 출발점으로 프롬프트당 일곱에서 여덟 번 반복하라는 제안을 기록하면서, 같은 호흡으로 단서를 붙입니다. 그 숫자는 “보편적 기준이 아니며”, 스위스 쿼리라는 작은 모집단과 최대 열 번의 반복에서 나온 것이라고.2

대신 권고하는 것은 순차적 정밀도 분석입니다. 관심 있는 양 주위의 구간이 눈앞의 결정에 충분할 만큼 좁아질 때까지 측정을 반복하라는 것입니다. 그것이 위 표를 거꾸로 돌리는 일입니다. 프롬프트 40개를 5회씩이면 “패널이 7포인트보다 크게 움직였는가”에 답합니다. 같은 40개를 8회씩이면 관측 320건에 ±5.4 구간이 되고, 수집을 감당할 수 있는 곳이라면 둘 중 출처가 더 탄탄한 쪽입니다.

유의점

이 산수는 어디서부터 맞지 않게 되는가

세 곳에서 맞지 않게 되고, 그중 둘은 당신에게 해당됩니다. 첫째는 극단적인 등장률입니다. Wilson 구간은 0과 1 안에 머물지만 교과서적 정규근사는 그러지 않고, 이 페이지가 그것을 쓰는 이유가 그것입니다. 대신 대칭이기를 그만둡니다. 관측 200건에서 2% 비율이면 구간은 0.8%에서 5.0%까지이므로, 반폭이 아니라 양쪽 끝을 함께 적으십시오. 실행이 군집을 이루거나 건수가 아주 적은 곳에서는 부트스트랩이 더 안전한 도구이며, 2026년 AI 가시성에 대한 통계적 분석도 인용 분포가 거듭제곱 법칙 모양이고 도메인 사이의 겉보기 차이 상당수가 측정의 노이즈 플로어 안에 있음을 발견한 뒤 그렇게 권고합니다.1

둘째는 같은 프롬프트의 실행들이 독립적인 추출이 아니라는 것입니다. 실행들은 쿼리와 리트리벌 경로를 공유하고 흔히 캐시도 공유해서 군집을 이루며, 군집된 관측은 같은 수의 독립 관측보다 정보를 적게 담습니다. 표준 보정은 설계 효과입니다. 1 + (m − 1) × 급내 상관계수이고, 여기서 m은 프롬프트당 실행 횟수입니다. 5회에 상관계수 0.5면 그 계수는 3이 되어 관측 200건이 67건처럼 행동하고, 구간은 ±7이 아니라 대략 ±12입니다. AI 답변 등장에 대해 그 상관계수를 추정한 공개 연구는 없으므로, 실행을 한 배치로 몰아 쏘지 말고 여러 날에 나누어 흩뿌리고, 여기 나오는 모든 구간을 하한으로 읽으십시오.

셋째는 이 공식이 표본을 뽑는 동안 p가 가만히 있었다고 가정한다는 것입니다. 한 주라면 대체로 방어할 수 있지만 한 분기라면 그렇지 않고, 긴 간격을 가로질러 비교한 패널 등장률은 당신의 작업과 엔진의 변화를 함께 측정하면서 둘을 갈라낼 방법이 없습니다. 위의 모든 것은 또한 숫자 하나 주위의 기간 내 구간입니다. 두 기간 사이의 변화가 진짜인지는 요구 조건이 훨씬 큰 두 비율 계산이고, AI 가시성 측정 단계의 몫입니다.

이 글의 정직한 한계

여기 있는 모든 숫자는 근사적으로만 참인 가정에 산수를 적용한 것입니다. 등장을 확률이 안정된 교환 가능한 베르누이 시행으로 다루는 것이 이 공식을 작동하게 하는데, 프롬프트 내부의 군집, 한 주 안의 드리프트, 프롬프트 사이의 차이가 모두 측정되지 않은 만큼 그것을 위반합니다. 따라서 이 구간들은 최선의 경우의 폭입니다. 이렇게 규모를 잡은 패널 등장률이 상업적인 무언가를 따라간다는 외부 검증도 없습니다. 이 분야가 스스로 내놓은 서베이는 인용 점수가 클릭, 전환, 매출을 예측한다는 주장을 매우 낮은 확신도로 평가합니다.2

제품이 쓸모 있는 자리와 그렇지 않은 자리

여기에 소프트웨어는 필요 없습니다. 구간은 스프레드시트 셀 하나, 1.96을 “(n + 3.84)의 제곱근의 2배”로 나눈 값입니다. 확장되지 않는 것은 수집입니다. 프롬프트 40개, 5회 실행, 엔진 5개면 주당 답변 천 건이고, 그 물량에서 수작업 수집은 지루한 일이기를 그만두고 믿을 수 없는 일이 됩니다. 지루해진 사람은 실행을 건너뛰고, 건너뛴 실행이야말로 이 산수가 볼 수 없는 실패이기 때문입니다. Bavior는 고정된 프롬프트 세트를 다섯 개 엔진에 정해진 일정으로 돌리고 각 답변이 인용한 출처를 기록해서 분모를 온전하게 유지합니다. 작은 표본을 실제보다 더 의미 있게 만들 수는 없고, 7포인트 구간 안의 4포인트 움직임을 결과로 칠지는 여전히 당신의 판단입니다. 무료 AI 가시성 체커무료 GEO 진단은 유료 플랜 없이 이용할 수 있습니다. 유료 플랜은 월간 결제 시 월 $99부터, 연간 결제 시 월 $79.17입니다(2026년 8월 30일 기준).

출처, 모두 2026년 8월 30일 확인
  1. Sielinski, “Quantifying Uncertainty in AI Visibility”, 2026년 3월, arXiv:2603.08924(프리프린트). 인용 분포는 거듭제곱 법칙 모양, 차이는 노이즈 플로어 안: arxiv.org/abs/2603.08924
  2. “A Critical Survey of Generative Engine Optimization (2023–2026)”, 2026년 7월 15일, arXiv:2607.14035. 일별 출처 수준 Jaccard 0.34–0.42, 반복에 따른 판정 변화 9–28%, 일곱에서 여덟 번 반복 제안, 확신도 표: arxiv.org/abs/2607.14035
  3. Grossman 외, SIGIR 2026. 쿼리 11,500건. Google 오가닉, AI Overviews, Gemini 사이의 URL 수준 Jaccard 0.11–0.18: arxiv.org/abs/2604.27790
  4. Li와 Sinnamon, 2024. 응답 1,008건 감사, 672건 단계별 분석, 고유 도메인 355개 중 26%가 두 시스템 모두에 인용됨
  5. Kirsten 외, Findings of ACL 2026. Google AI Overviews의 쿼리 4,706건 감사, 2025년 9월 발행. 참조된 도메인의 53%가 오가닉 상위 10위 밖: aclanthology.org/2026.findings-acl.526
  6. Xu, Iqbal, Montgomery, 2026(프리프린트). 트렌드 쿼리 55,393건, 2026년 3월 13일부터 4월 21일까지. 인용된 도메인의 29.8%가 첫 페이지에 없음: arxiv.org/abs/2605.14021
  7. Jaźwińska와 Chandrasekar, “AI Search Has a Citation Problem”, 컬럼비아대 Tow 센터, 2025년 3월 6일. 엔진 여덟 개, 쿼리 1,600건, 그중 60%가 넘는 쿼리에 틀린 답: cjr.org
  8. Zhang, He, Yao, “From Citation Selection to Citation Absorption”, arXiv:2604.25707(프리프린트). 통제된 프롬프트 602개, 검색 레이어 인용 21,143건. 프롬프트당 평균 인용 수 6.88 / 12.06 / 16.35: arxiv.org/abs/2604.25707
  9. 프롬프트 230,000개와 1억 건이 넘는 인용을 다룬 벤더 연구, 2025년 7월 14일부터 10월 12일까지, 어시스턴트 세 개. 큰 포럼 도메인 하나의 어떤 어시스턴트에서의 인용률이 2025년 8월 초에서 9월 중순 사이에 응답의 약 60%에서 약 10%로 떨어졌습니다. 벤더가 공개한 자료라 링크하지 않고 서술만 합니다.
  10. 미국 AI 검색 프롬프트 1.26억 건의 벤더 지수, 2026년 1월부터 4월까지. 한 어시스턴트는 응답당 평균 15개 출처를 인용했고 다른 하나는 3개였으며, 36개 브랜드가 측정된 모든 플랫폼에서 가시성을 유지했습니다. 벤더가 공개한 자료라 링크하지 않고 서술만 합니다.
  11. Brown, Cai, DasGupta, “Interval Estimation for a Binomial Proportion”, Statistical Science 16(2), 2001. 정규근사의 커버리지는 0과 1 근처에서 불안정: doi.org/10.1214/ss/1009213286
FAQ

자주 묻는 질문입니다.

프롬프트 40개는 규칙입니까, 아니면 그냥 딱 떨어지는 숫자입니까?

산수에 가장 가까운, 딱 떨어지는 숫자입니다. 등장률 50%에서 ±7포인트 Wilson 구간에 이르려면 관측 192건이 필요하고, 프롬프트 40개를 5회씩 돌리면 200건이 됩니다. 그러니 이 40은 원하는 구간과 감당할 수 있는 실행 횟수에서 나온 것이지, 프롬프트에 관한 무언가에서 나온 것이 아닙니다. 프롬프트 20개를 10회씩 돌려도 같은 관측 200건에 같은 구간이 되고, 구매 의도 커버리지만 좁아집니다. 어떻게 나눌지는 옳은 질문을 골랐다고 얼마나 확신하는지로 정하고, 총량은 공개할 각오가 된 구간의 넓이로 정하십시오.

왜 세 번이 아니라 다섯 번입니까?

다섯 번은 싼 정밀도가 바닥나는 지점이지, 근거가 뒷받침하는 임계값이 아닙니다. 프롬프트 40개짜리 패널에서 한 번 실행은 ±15포인트 구간, 세 번은 약 ±9, 다섯 번은 약 ±7입니다. 여섯 번째가 사는 것은 0.6포인트이고, 그 뒤로는 매번 1포인트의 절반에도 못 미칩니다. 수집이 비싸다면 세 번은 방어할 수 있는 절약이고, 숨기지 말고 보고서에 적어야 합니다. ±9 구간은 어떤 움직임을 결과라고 불러도 되는지를 바꾸기 때문입니다. 정확한 숫자보다 더 중요한 것은 그것이 기간 사이에 그대로 유지되는 것입니다.

수집을 전부 같은 날 오전에 돌려도 됩니까?

묶어서 돌리면 추정을 개선하지 않은 채 구간만 좁아 보이게 하므로, 실행을 여러 날에 나누십시오. 몇 분 안에 잇달아 쏜 실행들은 리트리벌 상태를 공유하고 흔히 캐시도 공유해서, 진짜로 독립적인 두 번의 추출보다 서로 더 비슷해집니다. 그래서 관측이 군집을 이루고, 군집된 관측은 그 개수가 시사하는 것보다 적은 정보를 담습니다. 이 보정에는 설계 효과라는 이름이 있지만, AI 답변에 대해 그것을 계산하는 데 필요한 상관계수를 공개한 연구는 아무도 없습니다. 실행을 흩뿌리는 것이 그것을 필요로 하지 않게 만드는 싼 방법입니다.

변화가 진짜였는지 따지는 것과는 어떻게 다릅니까?

이 페이지는 숫자 하나 주위의 구간을 정합니다. 전후 차이를 검정하는 것은 두 비율 비교이고, 몇 배나 많은 관측이 필요합니다. 30% 기준선에서 20포인트 움직임을 검출하려면 기간당 약 91건, 10포인트면 약 353건, 5포인트면 약 1,372건의 관측이 듭니다. 그래서 주당 관측 200건짜리 패널은 큰 변화보다 작은 것은 무엇도 정직하게 검출할 수 없습니다. 그 수치들은 AI 가시성 측정에서 AI 가시성 측정에 대해 풀어 놓은 두 비율 공식이고, 누구에게든 월간 추세선을 약속하기 전에 읽을 가장 유용한 한 편입니다.

Bavior 편집팀

Reddit 마케팅과 AI 검색 가시성에 관한 Bavior의 콘텐츠를 조사하고 관리하는 팀입니다. 본문의 모든 수치에는 출처와 확인 날짜를 명시했으며, 제휴 링크는 사용하지 않습니다.

수치에 오류를 발견하셨나요? 알려주시면 다시 확인하겠습니다: support@bavior.com

관측 이백 건이냐, 침묵이냐.
세 번째 선택지는 없습니다.

무료 체험 시작