首页/学习 GEO/面板规模
提示词研究 · 样本量

prompt 面板该建多大,每条又该跑多少次?

「在答案里出现」是一次偏差未知的抛硬币,所以整个问题就是普通的比例估计算术。把它写出来之后,它对这个领域惯常的汇报方式说了两句不太好听的话。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

每个引擎、每个周期约 40 条 prompt、每条跑 5 次,是能产出一个值得公布的数字的最小面板:200 次观测,在 50% 出现率下对应约 ±7 个百分点的 95% Wilson 区间。一条 prompt 跑一次的区间是 ±45 个百分点,跑五次约为 ±33,因此汇报单位是面板,永远不是单条 prompt。这个领域自己的批判性综述记录到,在可控采样的界面上,重复运行会改变 9% 到 28% 的判定,而这正是跑一次所掩盖的波动。2

关键要点
  • 数的是观测,不是 prompt 条数。一次观测 = 一条 prompt 在一个引擎上跑一次,所以 n 等于条数乘以次数,并且按引擎分别计。
  • 先买运行次数,买到每条约五次为止,然后再买 prompt 条数。超过每引擎每周期约 600 次观测之后,多买到的精度会被引擎自身的漂移抹掉。
  • 本页所有区间都是下限:同一条 prompt 的多次运行会聚集,而没有人公开过可用于校正它的相关系数。公布面板出现率时,请把 n、引擎和日期一并附上。
公式

出现率背后的算术是什么?

出现率是一个样本比例:每一次运行要么点了你的名,要么没有。每次运行都是一次伯努利抽样,其概率 p 观察不到,且属于「某条 prompt 在某个引擎上的某一周」;你能看到的,只是点了你名字的那部分运行的占比。本页所有区间都是 95% Wilson 得分区间,也就是 Brown、Cai 与 DasGupta 建议用来替代教科书正态近似的那一个。11 在 50% 出现率下,它的半宽是 1.96 除以「n 加 3.84 的平方根的两倍」,其中 n 是这个数字背后的观测次数。

有两个约定,能让它在你还没有任何数据时就可用。取 p = 0.5 来计算,因为 p(1−p) 在那里取到最大值,按最坏情况规划意味着你承诺过的区间绝不会比你实际拿到的更窄。另外,数的是观测而不是 prompt 条数:n 等于条数乘以运行次数,并且要按引擎分别计。

把它反过来用,就能直接给面板定规模。要达到半宽 w,你需要 n = 0.96/w² − 3.84 次观测:±10 个百分点约需 92 次,±7 约需 192 次,±5 约需 380 次。本页所有的 n 都是这笔算术,而不是研究结论,所以它们都没有标注到某篇论文;下面的出处,是给「算术在哪里失效」以及「引擎在底下移动了多少」用的。

区间

各个样本量下区间有多宽?

下表每一行都是同一个公式在不同 n 上的取值,对应一个引擎、一个周期。

该数字背后的观测n50% 出现率下的 95% Wilson 区间你可以诚实地说什么
1 条 prompt 跑 1 次1±45 个百分点什么都不能说。这是轶事
1 条 prompt 跑 5 次5±33 个百分点关于这条 prompt 本身,什么都不能说
1 条 prompt 跑 30 次30±17 个百分点只能说单条上的大幅变动
40 条 prompt × 1 次40±15 个百分点一个粗略的初始基线
40 条 prompt × 5 次200±7 个百分点面板出现率,按引擎、按周期
80 条 prompt × 5 次400±5 个百分点面板出现率,区间更紧
60 条 prompt × 10 次600±4 个百分点面板出现率,外加分类别拆分
60 条 prompt × 20 次1,200±2.8 个百分点引擎不会为你稳到这个精度

前四行请当作对仪表盘的警告来读。「单条 prompt 分数 + 周环比箭头」是大多数可见性报表的默认输出,而在跑五次的情况下,那个箭头画在 ±33 个百分点的区间里:底下什么都没变时,它也可以指向任何一边;哪怕把那一条 prompt 跑上三十次,也还剩 ±17。

最后一行请当作预算天花板来读。从 600 次观测翻倍到 1,200 次,只买到 1.2 个百分点的半宽,比这些系统自己在一周与下一周之间的移动幅度还小。这个领域自己的批判性综述把「逐日的来源重合度」放在 Jaccard 0.34 到 0.42 之间,24 小时内的重复运行也是相近水平,并且把结论说得很直白:可见性是一个分布,而「点估计不是一个稳定的指标」。2

汇报单位

为什么汇报单位是面板而不是 prompt?

面板之所以是汇报单位,是因为它是这套设计里「背后观测数足以撑起一个可用区间」的最小对象。单条 prompt 在现实的运行次数下,其区间比任何人想检出的效应宽好几倍,所以单条 prompt 的数字不是一个小的测量,它根本不是测量。该公布的句子长这样:在面板的 34% 的答案中被点名,±7,基于一个引擎上 40 条 prompt 各跑 5 次,8 月 24 日那一周,面板版本 3。

单条 prompt 依然有它的位置,但作为展品而不是指标。单条 prompt 上的答案正文,是唯一能说出「面板出现率为什么是这个数」的东西;每个周期人工读上一小把,正是抓住「被错误呈现」的方式:Tow 中心对八个引擎、1,600 条查询的审计发现,这些工具在超过 60% 的查询上答错了,而这在出现标记上会被记成一次胜利。7

引擎同样绝不合并。SIGIR 2026 上一项 11,500 条查询的研究测得,同一家公司的三个答案界面之间 URL 层面的 Jaccard 相似度只有 0.11 到 0.18;3 更早一项对 672 条分阶段回答的审计发现 355 个独立域名中,只有 26% 被所测的两个系统同时引用。4 一个跨引擎的综合出现率,是在给几乎不相交的群体取平均,也回答不了这个指标存在的唯一问题:接下来该在哪个引擎上使劲。面板也不是搜索排名的代理:在 2025 年 9 月采集的 4,706 条 AI Overviews 查询审计中,被查阅的域名有 53% 不在自然结果前十;5 而在 2026 年春季的 55,393 条查询研究中,有 29.8% 的被引域名不出现在整个首页上。6

资源分配

该多买 prompt,还是多买运行次数?

先买运行次数,买到每条约五次为止,然后买 prompt 条数,然后在每引擎每周期约 600 次观测处停手。在总量固定的前提下,两种买法得到的区间完全相同,因为 n 就是条数乘以次数,所以问题在于每一笔支出除了区间之外还买到了什么。运行次数买的是「你已经决定去问的那些问题」上的精度;prompt 条数买的是「你可能选错了的那些问题」上的覆盖度,后者在早期是更大的风险,到后期是更小的风险。

运行次数排在前面,是因为最开始几次异常便宜。把一个 40 条的面板从跑 1 次提到跑 5 次,区间从 ±15 收到 ±7,代价是多 160 次采集。而在同样跑 5 次的前提下把 40 条加到 80 条,只能从 ±7 收到 ±5,代价是 200 次。超过五次之后曲线变平,而继续在 prompt 上花钱的理由,就变成「去测量你当前完全看不见的意图」,那属于类别拆分那一篇。

天花板是由引擎定的,不是由算术定的。一份覆盖 230,000 条 prompt、超过 1 亿条引用、采集于 2025 年 7 月 14 日至 10 月 12 日的厂商时间序列记录到,某个大型论坛域名在某个助手上的引用率,从约 60% 的回答降到约 10%,时间是 8 月初到 9 月中。9 这是厂商发布而非同行评议的数据,但综述把「各商业引擎彼此不同,且随时间变化」评为高置信度。2

把成本说具体:40 条 prompt、跑 5 次、跨 5 个引擎,就是一周 1,000 次采集;60 条跑 10 次则是 3,000 次。读起来的成本也不均匀:目前唯一一份学术引用分类研究测得,三个助手每条 prompt 的平均被引来源数分别是 6.88、12.06 和 16.35。8

文献

公开研究给出过运行次数的建议吗?

给过,而且唯一一个公开的建议值高于五次。2026 年那篇批判性综述记录了一个建议:把每条 prompt 重复七到八次作为起点;它在同一段里就给这个数字加了限制:它「不是一个通用标准」,因为它来自一小批瑞士查询、最多十次重复。2

综述真正推荐的做法是序贯精度分析:不断重复测量,直到你关心的那个量的区间,窄到足以支撑你眼前的这个决定为止。这就是把上面那张表反过来用。40 条各跑五次,回答的是「面板有没有移动超过 7 个百分点」;而同样 40 条各跑八次是 320 次观测、±5.4 的区间,如果采集成本负担得起,它是两者中更有出处支撑的那一个。

注意事项

这套算术在哪里开始不成立?

它在三个地方不再成立,其中两个一定会落到你头上。第一个是极端的出现率。Wilson 区间不会像教科书正态近似那样跑到 0 与 1 之外,这正是本页采用它的理由。但它会不再对称:在 200 次观测、2% 出现率下,它是 0.8% 到 5.0%,所以请把两端都写出来,而不是给一个半宽。当运行相互聚集、或者计数很小时,bootstrap 是更稳妥的工具,2026 年那篇关于 AI 可见性的统计学论文也是这么建议的:它发现引用分布呈幂律形态,且域名之间许多表面上的差异,落在测量的噪声基底之内。1

第二个是:同一条 prompt 的多次运行并不是相互独立的抽样。它们共享一条查询、一条检索路径,往往还共享缓存,因此会聚集;而聚集的观测所携带的信息,少于同样数量的独立观测。标准的修正叫设计效应:1 +(m − 1)× 组内相关系数,其中 m 是每条 prompt 的运行次数。在跑 5 次、相关系数为 0.5 的情况下,这个系数是 3,200 次观测的表现相当于 67 次,区间约为 ±12,而不是 ±7。目前没有任何公开研究估计过 AI 答案出现率上的这个相关系数,所以请把运行分散到不同日期,而不是一批打完,并且把本页所有区间读作下限。

第三个是:这个公式假设你抽样期间 p 保持不动。在一周的尺度上,这大致站得住;在一个季度的尺度上就不成立了,而跨越很长间隔比较的面板出现率,是把你的工作和引擎的变化混在一起测量,且无从分离。上面的一切也都是围绕单个数字的「周期内区间」;两个周期之间的变化是不是真的,那是一个双比例计算,要求高得多,它属于衡量 AI 可见度这一阶段

本文的诚实边界

本页每一个数字都是把算术套在一个只是近似成立的假设上。把「出现」当作概率稳定、可交换的伯努利抽样,是这个公式能成立的前提;而 prompt 内部的聚集、一周之内的漂移,以及不同 prompt 之间的差异,都在以一个没人测量过的幅度违反它。因此这些区间是最好情况下的宽度。另外也没有任何外部验证表明,用这种方式定规模的面板出现率能追踪到任何商业量:这个领域自己的综述把「引用分数能预测点击、转化或收入」评为极低置信度。2

产品在哪里派得上用场,在哪里派不上

这些都不需要软件。区间就是一个表格单元格:1.96 除以「n 加 3.84 的平方根的两倍」。真正扩展不了的是采集:40 条 prompt、5 次运行、5 个引擎,就是一周一千条答案;在这个量级上,人工采集不再只是繁琐,而是不再可靠,因为无聊的人会跳过运行,而「跳过的运行」恰恰是这套算术看不见的那种失败。Bavior 按计划把一组固定的 prompt 打到五个引擎上,并记录每条答案引用了哪些来源,让分母保持完整。它无法让一个小样本比它本身更有意义,而「7 个百分点区间里的 4 个百分点变动算不算一个结果」,这个判断依然是你的。免费 AI 可见性检测免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 30 日)。

出处,全部核查于 2026 年 8 月 30 日
  1. Sielinski,《Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement》,2026 年 3 月,arXiv:2603.08924(预印本);引用分布呈幂律形态,表面差异落在噪声基底之内:arxiv.org/abs/2603.08924
  2. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035;逐日来源层 Jaccard 0.34–0.42,9–28% 重复判定改变,七到八次重复的建议及其限定,以及置信度表:arxiv.org/abs/2607.14035
  3. Grossman 等,SIGIR 2026;11,500 条查询;Google 自然结果、AI Overviews 与 Gemini 之间 URL 层面的 Jaccard 为 0.11–0.18:arxiv.org/abs/2604.27790
  4. Li 与 Sinnamon,2024;对 1,008 条回答的审计,其中 672 条做了分阶段分析,355 个独立域名中有 26% 被两个系统同时引用
  5. Kirsten 等,Findings of ACL 2026;对 Google AI Overviews 的 4,706 条查询审计,查询发出于 2025 年 9 月;被查阅域名中有 53% 不在自然结果前十:aclanthology.org/2026.findings-acl.526
  6. Xu、Iqbal 与 Montgomery,2026;55,393 条趋势查询,采集于 2026 年 3 月 13 日至 4 月 21 日(预印本);29.8% 的被引域名不出现在首页上:arxiv.org/abs/2605.14021
  7. Jaźwińska 与 Chandrasekar,《AI Search Has a Citation Problem》,哥伦比亚大学 Tow 数字新闻中心,2025 年 3 月 6 日;八个引擎,超过 60% 的查询得到错误答案:cjr.org
  8. Zhang、He 与 Yao,《From Citation Selection to Citation Absorption》,arXiv:2604.25707(预印本,仅描述性统计);602 条受控 prompt,21,143 条搜索层引用;每条 prompt 的平均被引来源数为 6.88 / 12.06 / 16.35:arxiv.org/abs/2604.25707
  9. 某厂商研究:230,000 条 prompt、超过 1 亿条引用,采集于 2025 年 7 月 14 日至 10 月 12 日,覆盖三个助手;某大型论坛域名在某个助手上的引用率,在 2025 年 8 月初至 9 月中期间从约 60% 的回答降至约 10%。厂商发布;按本课程的出处规则,只转述不外链。
  10. 某厂商指数:2026 年 1 月至 4 月、1.26 亿条美国 AI 搜索 prompt;一个助手每条回答平均引用 15 个来源,另一个为 3 个,而只有 36 个品牌在所测的每个平台上都保住了可见性。厂商发布;按本课程的出处规则,只转述不外链。
  11. Brown、Cai 与 DasGupta,《Interval Estimation for a Binomial Proportion》,Statistical Science 16(2),2001;正态近似在接近 0 和 1 处的覆盖率很不稳定:doi.org/10.1214/ss/1009213286
常见问题

你想知道的,都在这里。

40 条 prompt 是硬规则,还是一个凑整的数?

它是最接近那笔算术的整数。在 50% 出现率下要拿到 ±7 个百分点的 Wilson 区间,需要 192 次观测,而 40 条 prompt 各跑 5 次是 200 次,所以这个 40 来自「你想要的区间」和「你付得起的运行次数」,与 prompt 本身无关。20 条 prompt 各跑 10 次同样是 200 次观测、同样的区间,只是对买家意图的覆盖更窄。用「你有多确信自己选对了问题」来决定怎么拆,用「你愿意公布多宽的区间」来决定总量。

为什么是跑五次而不是三次?

五次是「便宜的精度」用完的地方,不是一个有证据支撑的阈值。在 40 条的面板上,跑 1 次是 ±15 个百分点,跑 3 次约 ±9,跑 5 次约 ±7;第六次买到 0.6 个百分点,此后每一次都买不到半个百分点。如果采集成本高,跑三次是一个站得住脚的节省方案,但应当写进报告而不是藏起来,因为 ±9 的区间会改变「哪些变动可以被称为结果」。比这个具体数字更重要的,是它在各周期之间保持不变。

我能把所有采集都放在同一个上午跑完吗?

批量跑会在不改善估计质量的情况下让你的区间看起来更窄,所以请把运行分散到不同日期。相隔几分钟发出的运行共享同一套检索状态、往往还共享缓存,这让它们比两次真正独立的抽样更相似:观测被聚集了,而聚集的观测所携带的信息量少于它们的条数所暗示的。这个修正有个名字,叫设计效应,而目前没有任何公开研究提供了在 AI 答案上计算它所需的相关系数。把运行分散开,是绕开这个问题的廉价办法。

这和「判断一次变化是不是真的」有什么区别?

本页算的是围绕单个数字的区间;而检验前后差异是一个双比例比较,需要的观测数是前者的好几倍。以 30% 为基线,要检出 20 个百分点的变动约需每周期 91 次观测,10 个百分点约需 353 次,5 个百分点约需 1,372 次,也就是说,一个每周 200 次观测的面板,诚实地讲无法检出任何小于大幅变动的东西。这些数字来自双比例公式,完整推导在「测量 AI 可见性」的衡量 AI 可见度 里,而它是你在向任何人承诺月度趋势线之前最该读的一份东西。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

要么两百次观测,要么闭嘴。
没有第三种选择。

免费试用