首页/学习 GEO/统计功效
衡量 AI 可见度 · 那个计算

一次前后对比,需要多大的统计功效?

有一个公式决定了你的前后对比有没有意义,而它短到可以手算。本页的每一个数字都由它推出,包括关于周报的那个不太好听的结论。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

一次前后对比需要多少次观测,取决于你愿意据以行动的最小变化;两比例样本量公式会告诉你具体数字:n = (1.96 + 0.84)² × [p₁(1−p₁) + p₂(1−p₂)] ÷ δ²,取功效 80%、双侧显著性水平 5%。从 30% 的起始比率出发,检测 10 个百分点的变化约需每周期 353 次观测,检测 2 个百分点约需 8,400 次;因此一份每个引擎带 200 次观测的周报,只能分辨出约 13 到 14 个百分点,再小就不行。功效不足的检验是已发表研究的常态:2013 年一篇回顾覆盖 49 项元分析、730 项研究,得出该文献的统计功效中位数为 21%。10

要点
  • 数的是观测数,不是 prompt 条数。一次观测是“一条 prompt 在一个引擎上跑一次”,所以 60 条 prompt 跑六次就是 360 次。
  • 需求量是平方关系:想检测的变化减半,需要的数据就翻两番。心算用“观测数 ≈ 3.5 ÷ δ²”就够在会议上核一遍。
  • 周度数字撑不起一根趋势箭头。请按月发布;面板稳定时采用配对设计;并留一组你从不针对性优化的 prompt,好让引擎漂移不被读成你的效果。
公式

前后对比的样本量公式是什么?

比较两个比率所需的样本量,用的就是那个普通的两比例公式,而本页的每一个数字都由它推出:n = (zα/2 + zβ)² × [p₁(1−p₁) + p₂(1−p₂)] ÷ (p₂ − p₁)²。在惯例设定下,即双侧 5% 显著性水平故 zα/2 = 1.96、功效 80% 故 zβ = 0.84,前面那个常数就是 2.8² = 7.84。

每一项都对应一个你必须在收集数据之前就定下来的东西。p₁ 是你出发时的比率,要实测,不能拍脑袋。p₂ 是你希望自己有能力检测到的比率,它是一个业务决定而不是统计决定:它是“小到再小就不会改变你下季度投什么”的那个最小改进幅度。δ = p₂ − p₁ 是这个差值,以小数写出的百分点。而 n 是前后两个周期中每一个的观测数,其中一次观测是“一条 prompt 在一个引擎上跑一次”。

手算一行,其余就都可核对了。从 30% 到 40%:p₁(1−p₁) = 0.30 × 0.70 = 0.21;p₂(1−p₂) = 0.40 × 0.60 = 0.24;两者之和为 0.45;乘以 7.84 得 3.528;再除以 δ² = 0.10² = 0.01,得 352.8。也就是前期 353 次观测、后期 353 次。

这些都不是 AI 搜索特有的,也不是任何论文的发现:它是任何二值结果比较都适用的算术。而上面这个版本是流通中的两个里较小的那一个。Casagrande、Pike 与 Smith 的连续性校正公式(多数计算器跑的就是它)给出的 n 比上面这个朴素版本更大,所以请把本页每一个数字都读作下限。6 “一个比率的精度”和“两个比率之差的可检测性”是两个不同的计算,按前者定尺寸的面板用在后者上往往太小;前者属于提示词研究 的《多少条 prompt、跑多少次》

数字

每种幅度的变化各需要多少次观测?

全部从 30% 的起始比率算起、按引擎计:20 个百分点的变化约需每周期 91 次观测,10 个百分点约 353 次,5 个百分点约 1,372 次,2 个百分点约 8,400 次。中间那一列是方差项,好让每一行都能对着公式核算。

要检测的变化p₁(1−p₁) + p₂(1−p₂)每周期观测数能达成它的面板
30% → 50%(20 个百分点)0.460约 9120 条 prompt × 5 次
30% → 40%(10 个百分点)0.450约 35360 条 prompt × 6 次
30% → 35%(5 个百分点)0.438约 1,37260 条 prompt × 23 次,做不到每周
30% → 32%(2 个百分点)0.428约 8,400在任何合理节奏下都不可行

这张表有两个性质,比其中任何一行都更要紧。第一,需求量与 δ 成平方反比:想检测的效应减半,需要的数据就翻两番。这就是为什么第一行和最后一行之间只差十八个百分点,样本量却差了约九十倍;而它正是决定一个项目负担得起什么汇报节奏的那个事实。

第二,方差项几乎不动,整张表里只在 0.428 到 0.460 之间,所以几乎全部变化都来自 δ 本身。这给了你一个在这个区间内误差约 5% 以内的捷径:观测数 ≈ 3.5 ÷ δ²,δ 以小数计。

后果

一份 200 次观测的周报能检测出什么?

一份每个引擎带 200 次观测的周报,能检测出约 13 到 14 个百分点的变化,再小就不行。把捷径反过来用:3.5 ÷ 200 = 0.0175,开方得 0.132。用精确公式从 30% 的基线求解,约为 13.5 个百分点。所以从 30% 涨到 44% 刚好在可检测的边缘上,而从 30% 涨到 35% 是看不见的,不管仪表盘把它画得多么笃定。

这个推论不太好听:一份 GEO 周报,诚实地讲,除了大幅变动之外什么都检测不出来。比这更小的都是波动;把它当作进展来汇报,就是一个项目在第四个月、曲线毫无理由地回落时失去公信力的方式。

同一套算术也解释了为什么读这个领域已发表的案例研究时要把样本量拿在手上。生成式引擎优化里最出名的那句主张是“GEO 能把可见性提升 40%”。2026 年那篇批判性综述把它列为作为一般性主张被否决,因为这个数字来自开山学术论文,是“在特定配置下、某一个指标上的相对最大值”,而那篇论文测的是固定上下文内一个位置加权指标,而不是在真实引擎上的可见性。24 大多数案例研究失败得更安静:当有人写下“重写之后可见性从 22% 升到 27%”,该问的是每个数字背后有多少次观测;每边低于约 1,400 次时,那个对比就无法把效应与噪声分开。这是功效不足,不是不诚实,这条同样适用于我们自己发布的任何东西。

M 型与 S 型错误

一个功效不足的检验给出的显著结果,会把什么夸大?

夸大的是它自己的效应量,而且夸大的倍数可以事先算出来。功效低的时候,只有那些恰好冲得过头的估计才够得着显著性阈值,所以“以显著性筛选”本身就是在筛选夸大。Gelman 与 Carlin 把这个失真的幅度称为夸大比(exaggeration ratio),即“效应量可能被高估的倍数”,并把它与 S 型错误配成一对:后者是显著估计的符号弄反了的概率。9

它落到实处是这样:一个只够检测 13 个百分点的对比,在真实效应只有 4 个百分点、而它偶尔给出显著结果的那些场合,报出来的数会比 4 大得多。这不是检验的毛病,这就是“对一个含噪估计施加显著性筛选”的必然结果;也正因如此,一个 GEO 项目的第一个季度常常产出一个事后谁也复现不了的数字。

这是已发表研究的常态,而不是个别角落。2013 年那篇确立此论点的回顾,给出 49 项神经科学元分析、共 730 项研究的统计功效中位数为 21%。10 目前没有针对 AI 可见性案例研究的同类审计,而既然它们大多只跑一次,稳妥的假设是这个数字更低。应对办法不是更聪明的检验,而是在看数据之前就把“多大的效应你才会据以行动”定下来,并把第一个显著结果当成一个待重跑的假设,而不是一个可以宣布的结论。

三个杠杆

怎样在不增加运行次数的前提下买到检测力?

有三个杠杆能在不给日程加一次运行的前提下提高一次对比的可检测幅度:拉长周期、在 prompt 类别内合并、以及采用配对设计。它们作用在“对比”上而不是“面板”上,所以可以和提示词研究 给你的 prompt 与运行次数分配叠加使用。

拉长周期。月度对比会把你本来就在做的四周运行聚合起来,于是 200 次观测变成 800 次,可检测效应从约 13.5 个百分点降到约 6.6 个。请注意这个兑换率:四倍的数据只买到两倍的分辨率,因为需求量是平方关系。也正因如此,周度节奏不是靠耐心就能救回来的:它必须被放弃作为汇报单位,只保留为运营检查。

在 prompt 类别内合并。比较一整类 prompt 的前后变化,而不是单条 prompt,反正内容改动本来就该在类别层面体现。让这件事成立的纪律是:只在同一类别内合并,绝不跨类别。各类别是独立变动的,把你涨了十二个百分点的那一类和四个持平的类别混在一起,会把一个真实效应稀释成检测不到的;那样合并就不是买到功效,而是赔掉了功效。跨引擎合并更糟,因为它们检索到的来源本来就几乎不重叠。3

采用配对设计。前后跑完全相同的面板,用 McNemar 检验逐条 prompt 比较;它只用那些状态发生了改变的 prompt,因此把 prompt 之间的差异整个从比较中剔除了。所需配对数由 Connor 的公式给出:[1.96√ψ + 0.84√(ψ − δ²)]² ÷ δ²,其中 ψ 是两次测量之间发生翻转的 prompt 占比。7 要检测 10 个百分点的净变化、且 20% 的 prompt 会翻转,大约需要 155 个 prompt 配对,总计 310 次观测,而非配对设计要 706 次。这份节省来自稳定性,所以在答案最不易变的引擎上最大,在每次运行都大幅重掷的引擎上最小。

它在哪里失效

这个计算在什么时候就不成立了?

公式底下压着三条假设,而在 AI 可见性测量里,这三条都朝着“让数字显得比实际更好看”的方向被违反。第一条是正态近似,它在比率接近 0 或 1 时表现很不稳定:Brown、Cai 与 DasGupta 指出,标准区间在那里的覆盖率很差,而且不会随 n 增大而平滑改善。8 如果你只在 4% 的答案里被点名,这个公式报出的样本量就偏乐观。请改用 Wilson 区间或 bootstrap,这也是 2026 年 3 月那篇 AI 可见性测量统计学论文的建议:该文对引擎做了连续九天的每日采样以及十分钟间隔的采样,发现引用计数呈幂律形状,且整个高频被引集合内部的排名都不稳定。1

第二条是独立性。公式假设每次观测都是一次全新抽样,而在几分钟内成批打出去的运行并不是:它们碰到的是同一个索引状态、同一份缓存、同一个模型检查点。请把运行分散到整个周期,而不是集中在一个下午打完。只要运行在时间上聚集,有效样本量就小于名义样本量;而目前没有任何针对 AI 可见性面板的设计效应估计被发表过,所以没人能告诉你小多少。

第三条是“引擎在你两次测量之间没有变化”。这一条经常被违反,也是后果最严重的一条,因为它一旦失效,你测的就是平台而不是你的工作。一项覆盖 230,000 条 prompt、超过 1 亿条引用、采集于 2025 年 7 月中至 10 月中的三个月商业研究记录到,某个助手对某个大型讨论平台的引用率在约六周内从占回答的约 60% 掉到约 10%。5 2026 年那篇批判性综述把“商业引擎彼此不同且随时间变化”评为置信度。2 应对办法是保留一组你从不针对性优化的对照 prompt,让平台漂移与你的效应分开显现;怎么建、怎么读,见关于报告本身的姊妹篇

本文的诚实边界

这里的每一个数字都是下界,而不是估计值。公式假设的是“从一个静止系统中抽取的独立样本”,而 AI 回答引擎两样都不提供:一天之内的多次运行彼此相关,引擎也在测量底下悄无声息地变化。这两处违反都朝同一个方向推,意味着真实需求量大于表中的数字,而没人说得出大多少,因为从来没有人发表过针对 prompt 面板的设计效应估计。请把“10 个百分点需要 353 次观测”当作一个理想世界里的最低值,按更多去规划,并对任何报出更小数字的人保持怀疑,包括我们自己。

产品在哪里派得上用场,在哪里派不上

整个计算就是四次乘法和一次除法,一张电子表格就能做。给一次测试定样本量不需要任何软件,而已经太小的测试,也没有任何软件能把它的功效提上来。Bavior 按计划把固定 prompt 面板打到五个引擎上,并记录每一次运行的结果,包括那些什么都没发生的运行,那正是这个计算要消耗的原料。它不做的事情是:替你跑显著性检验、替你决定对照组,或由引用推算流量与收入;该领域自己的综述把最后这条关联评为极低置信度。2 免费可见性检测免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 29 日)。

出处,全部核查于 2026 年 8 月 30 日
  1. Sielinski,《Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement》,2026 年 3 月,arXiv:2603.08924(预印本);建议以 bootstrap 区间报告引用份额估计:arxiv.org/abs/2603.08924
  2. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035;含置信度表,其中包括被否决的一般性主张,以及被评为高置信度的“商业引擎彼此不同且随时间变化”(综述预印本):arxiv.org/abs/2607.14035
  3. Grossman 等,《How Generative AI Disrupts Search》,SIGIR 2026,arXiv:2604.27790;11,500 条查询;论文正文写明 Google 自然结果、AI Overviews 与 Gemini 三者来源之间的 Jaccard 相似度介于 0.11 到 0.18 之间,摘要则概括为低于 0.2:arxiv.org/abs/2604.27790
  4. Aggarwal 等,《GEO: Generative Engine Optimization》,KDD ’24;那个 40% 数字的来源,其性质是固定上下文内某个位置加权指标上的相对最大值:arxiv.org/abs/2311.09735
  5. 某引用研究,2025 年 11 月 10 日发布:230,000 条 prompt、超过 1 亿条引用,采集于 2025 年 7 月 14 日至 10 月 12 日;某助手对某个大型讨论平台的引用率在约六周内从占回答的约 60% 降至约 10%。厂商发布,故按本课程规则只描述、不链接。
  6. Casagrande、Pike、Smith,《An Improved Approximate Formula for Calculating Sample Sizes for Comparing Two Binomial Distributions》,Biometrics 34(3):483,1978;该公式的连续性校正版本:doi.org/10.2307/2530613
  7. Connor,《Sample Size for Testing Differences in Proportions for the Paired-Sample Design》,Biometrics 43(1):207,1987;配对设计的样本量公式:doi.org/10.2307/2531961
  8. Brown、Cai、DasGupta,《Interval Estimation for a Binomial Proportion》,Statistical Science 16(2),2001;在接近 0 与 1 处覆盖率表现不稳定:doi.org/10.1214/ss/1009213286
  9. Gelman、Carlin,《Beyond Power Calculations: Assessing Type S (Sign) and Type M (Magnitude) Errors》,Perspectives on Psychological Science 9(6):641–651,2014;夸大比:doi.org/10.1177/1745691614551642
  10. Button 等,《Power failure: why small sample size undermines the reliability of neuroscience》,Nature Reviews Neuroscience 14(5):365–376,2013;49 项元分析、730 项研究的统计功效中位数为 21%:doi.org/10.1038/nrn3475
常见问题

你想知道的,都在这里。

要证明我的 GEO 工作起了作用,需要多少次观测?

这完全取决于你想证明的差异有多大,而且两者是平方关系。从 30% 的起始比率出发,检测 20 个百分点的变化约需每周期 91 次观测,10 个百分点约 353 次,5 个百分点约 1,372 次,2 个百分点约 8,400 次,按引擎计,功效 80%、双侧显著性水平 5%。一次观测是“一条 prompt 在一个引擎上跑一次”,所以 60 条 prompt 跑六次就是 360 次。请先决定“多大的变化才会改变一个投入决策”,再按那个幅度去设计样本量,而不是先收数据、事后再问它能支撑什么。

我能不能就按周汇报 AI 可见性,同时注明“它有噪声”?

你可以把它作为一项运营检查按周去跑,但不该在上面画趋势箭头。每个引擎每周约 200 次观测时,从 30% 的基线出发,能与噪声区分开的最小变化约为 13 到 14 个百分点,所以你看到的几乎每一次周环比变动都是波动。可行的安排是:按周运行、按周人工阅读答案以获取定性信号,比如冒出来的新竞品、关于你产品的新错误陈述,而把数字按月发布;同样的运行聚合四周,可检测效应会降到约 6.6 个百分点。

配对的前后设计真的需要更少数据吗?

是的,而且当你的面板足够稳定时,节省幅度很大。配对设计在前后两次使用完全相同的 prompt,并用 McNemar 检验逐条比较,它只统计状态发生改变的那些 prompt,因此 prompt 之间的差异从比较中被消掉了。要检测 10 个百分点的净变化,且两次测量之间有 20% 的 prompt 翻转,你大约需要 155 个 prompt 配对,总计 310 次观测,而非配对设计需要 706 次。这份节省来自稳定性,所以在“答案在多次运行之间大幅重掷”的引擎上会缩小;而如果你在两次测量之间改了 prompt 清单,它会完全消失。

我的比率只有 4%,这个公式还适用吗?

不太可靠。在接近 0 或 1 的区间,它背后的正态近似表现很不稳定,覆盖率很差,它给出的样本量会偏乐观。在这些区间请改用 Wilson 区间或 bootstrap,这也是 2026 年 3 月那篇 AI 可见性测量统计学论文的建议:该文发现引用计数呈幂律形状,且整个高频被引集合内部的排名都不稳定。对一个处在 4% 的品牌来说,实际后果是:几乎没有任何东西能在周与周之间被检测到;一份诚实的报告会直说这一点,而不是在这么小的基数上展示一个百分比变化。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

先把样本量定好,再去跑。
这样得到的数字才算数。

免费试用