首页/学习 GEO/测出零效应的手法
面向 AI 引用的内容 · 方法

为什么多数内容手法都测出零结果?

那个效应从一开始就比测试能看见的还小。零结果首先是关于你这次测量的事实,其次才是关于这个手法的事实,而把两者分开,就是这件事里大部分的功夫。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

零结果的意思是这次测试没能看见效应,它首先是关于测试的陈述,其次才是关于手法的陈述。请把它当成常态来预期:C-SEO Bench 这项 NeurIPS 2025 的基准测试,在六个领域上测了十种对话式 SEO 方法,54 个“方法 × 领域”案例中只有三个显著为正;而在它的主结果表里,这十种方法每一种的标准差都大于它自己的均值,通常是好几倍。1 长成这样的数字本来就分辨不出小效应,无论那个效应实际是多少。

关键要点
  • 零结果之所以是常态,有三个结构性原因:效应本来就小;同一处改动在有些查询上有帮助、在另一些上有害;引擎自己在两次完全相同的运行之间就会改口。
  • 要宣称一个手法毫无作用,你需要一个把“你本会据此行动的最小变化”排除在外的区间。这个领域自己的综述至今还得要求研究给出区间与分布,而不是只给一个均值。3
  • 负结果携带的信息远多于零结果。KDD 2026 的 SAGEO Arena 发现,只改正文的十种策略在检索、重排和引用三个环节全部下滑。2
  • 读你自己的零结果时,请对照没有改动的对照页面,而不是对照上个月:这个面自己就在翻动,AI Overviews 两个月之间的页面重合度是 18%,而 Google 自然结果是 45%。4
先验

为什么零结果在这里是预期结果?

因为内容改动是流水线最后一环上的一次小干预,而测量它的仪器自己就会动。

先看看要找的东西有多大。C-SEO Bench 发表于 NeurIPS 2025 数据集与基准赛道,在六个领域上跑了总计十种内容方法,覆盖逾 1.9k 条查询与 16k 份文档。在零售那一列里,十种方法中最强的一种平均把目标文档的排名提升 0.36 位,最弱的是 −0.07 位;而只是把文档放到模型上下文的第一位(这正是排名在做的事),价值是 2.77 位。1 三分之一个排名位的效应不只是难以检出,它小到就算检出了也不会改变你周一要做的事。

仪器本身也在动。在温度可控的那些面上,温度为零时重复运行会改变 9–28% 的决策,这是在美国和德国的 4,706 条查询上测出来的。4 同一个问题问两遍,就不是同一个实验。任何比这个抖动更小的效应,从构造上就是看不见的,改写写得再仔细也没用。

还有总体的问题。C-SEO Bench 写道,它的这些方法产生的位移“既有正的也有负的,并且部分相互抵消”:在零售数据上最强的那个方法,在 26.2% 的案例里有正向提升,在 12.8% 的案例里是负向,于是“总体平均效应接近零,但方差很大”。1 54 个案例里只有三个显著为正,而这个判定是经过 Holm-Bonferroni 校正的,所以这三个不是“测得多了”撞出来的假阳性。1 拥有这些性质的领域产出零结果,就像抛硬币产出正面一样自然。

离散度

标准差大于均值,说明了什么?

它说明的是:对任何单独一条查询而言,决定结果的是“这是哪条查询”,而不是“你用了哪个手法”。看看那份基准测试零售列的写法:最好的内容方法是 0.36 ±1.47,而作为参照的那个 SEO 动作,全表最强的数字,也不过是 2.77 ±2.31。1 离散度本身就是结论。它意味着在完全相同的干预下,一份文档可能升四位,也可能掉三位,而你个人拿到哪一种,接近于抽签。

由此有三个推论,它们其实就是本页全部的实用内容。第一,一个页面在一条提示词上做前后对比,只是从那个分布里抽了一次,因此它对均值几乎不提供任何信息,正反两个方向都不提供。第二,一个为正的均值完全可以与相当比例的亏损共存,所以只报均值永远不够:2026 年那篇批判性综述的方法学章节明确要求报告“绝对效应、相对效应、区间与分布,而不只是一个均值”。3 第三,你需要的观测数量随方差增长、随效应量的平方下降,所以一个落在宽分布里的小效应,看清它的代价非常高。

这一点背后的算术写在本站别处:样本量公式给出某个变化幅度所需的每期观测数,要多少提示词和多少次运行把它换算成一个你跑得起来的面板。请在设计测试之前读,而不是在读到结果之后。

零结果不是什么

零结果是不是说明这个手法没用?

不是,而这两句话之间的缝隙,正是多数 GEO 报告出错的地方。“我们没有检出效应”和“我们检出了不存在效应”是两个不同的主张,需要的证据也不同。前者只需要一次测试。后者需要一个窄到足以排除“所有你本会据此行动的效应量”的区间,那要难得多,也少见得多。

解决这件事的纪律不花钱,而且发生在测试之前:先写下你会据此行动的最小变化,再看你的面板能不能分辨它。30 个观测的面板,在 50% 出现率上的 95% Wilson 区间大约是 ±17 个百分点,所以一个真实存在的 5 个百分点的提升,每一次跑都会读成零结果。那次测试的结论由它的规模决定,而不是由手法决定;提前知道这一点,就是不做这次测试的理由。

反过来的那个错误也值得点名。对一个 0.36 个排名位的效应得出零结果,既与“效应真实存在”相容,也与“它对你一文不值”相容,所以零结果和一个极小的真实效应本来就会导向同一个决定。

方向

负结果和零结果有什么不同?

零结果不给你方向,所以你的先验原地不动。而在许多策略与多个环节上一致的符号,给你一个方向和一个机制。

只改正文的改写检索,前 20 命中率重排后,前 10 命中率引用率
基线,不改写0.581.000.50
流畅度0.57(−1%)0.91(−9%)0.50(−1%)
加统计数字0.57(−2%)0.90(−10%)0.48(−4%)
专业术语0.50(−14%)0.80(−20%)0.47(−6%)
八种一起上0.50(−14%)0.83(−17%)0.49(−2%)
十种的平均0.53(−9%)0.84(−16%)0.47(−6%)

SAGEO Arena 已被 KDD 2026 接收,它没有给模型一个固定上下文,而是把整条流水线重建了出来:171,003 份文档、2,700 条查询、每个领域 300 条,检索、重排与生成都在其中。它报告说,只优化正文“在所有环节上都会一致地削弱可见度”,而上面那张表就是这句话立得住的原因:十种策略在三列上全部下滑。2 三十个格子,一个符号。这三个环节是嵌套的而不是独立的,所以那不是三十次独立试验;但十种不同的改写在它们触及的每个环节上都朝同一个方向动,这是一个方向,不是抛硬币。

机制是被写出来的,而不是猜出来的,这正是它高于零结果的地方。检索端跌得最多的,是那些把常用表达换成领域专有词或生僻词的策略,作者把这归因于“优化后的文档与用户查询之间的词汇错配,而用户查询通常使用常用词汇”,并举例说把“sleeping”换成“somnolence”,词面检索器给这一页的打分就会更低。2 C-SEO Bench 从另一侧发现了同样的不对称:它的左尾检验显示,加统计数字这个方法在 24 个受测设定中的 19 个里降低了排名。1 凡是这些基准去检验“是否有害”的地方,它们经常真的找到了;这与“没能找到帮助”是完全不同的认知处境。

在有人引用那张表之前,还有两处需要老实扣掉。重排的基线是构造出来的 1.00,因为“所有目标文档都是从重排阶段的前十候选中选出的”,所以那一列只能往下走,它的 −16% 与一个基线自由浮动的百分比并不可比。2 另外,“只改正文”只是论文报告的三种设定之一;当结构与正文一起优化时,数字会变。

你自己的测试

你自己站点上的零结果该怎么读?

六个问题,按这个顺序问。多数内部的零结果在前四个里的某一个上就停住了。

01

这个效应本来能被检出吗?

先写下值得据此行动的最小变化,再看你的面板在那个幅度上给出的区间有多宽。如果区间比变化还宽,那么这个零结果在测试开跑之前就已经写好了。

02

这次改动真的上线了吗?

像爬虫那样把改过的页面抓一遍,确认新正文就在响应里。一次从未变得可检索的改写,产出的是关于你部署的零结果,而它藏身之处正是检索阶段

03

基线在原地不动吗?

AI Overviews 两个月之间的页面重合度是 18%,Google 自然结果是 45%。4 跨越这么长时间的前后对比,量到的多半是自然翻动,所以请留一批不动的页面做对照。

04

你一次只改了一件事吗?

一个打包方案测出零结果,对它的各个部分什么也没说明,而且它可能把一处赢和一处输互相抵消掉了。上面那份基准里“全部一起上”的条件在检索上是 −14%,比它的多数配料还差。

05

你把失败的那些留下了吗?

综述对最常见的那种静默偏差说得很直白:“没有搜索、没有引用或带错误的输出,是结果,不是可以丢掉的数据。”3 丢掉它们会把你报告的每一个比率都抬高。

06

你是不是把各次运行当成独立的了?

“查询、来源与日期都是成簇的单位。把所有生成当作彼此独立来检验,会低估不确定性。”3 同一条提示词跑五次,不是五个观测。

一支团队在一次发布里改写了自己四十个文档页面,然后用一个三十观测的面板去比较发布前后各一个月,几乎每次都会报出零结果,而且对这次改写什么也没学到。上面六个问题里已经有三个答错了:面板分辨不了小于约十七个百分点的东西;八处改动作为一处发布了出去;而比较的时间跨度长到这个面自己就已经换过一轮。同一支团队改二十个页面、留二十个不动,并且先把面板规模算好,那么即便答案是“什么都没动”,这个答案也值得拥有。

决策

对一个测出零结果的手法该怎么办?

请用成本和风险来决定,而不是用显著性,因为你要买的从来就不是显著性。一个便宜、无害、而且本来就有别的理由值得做的手法,能完好地熬过一个零结果:问句式小标题、平实的定义、带日期和出处的数字,都会让页面对着它读的人更好,所以它们的引用效果是附赠品,而不是做它们的理由。一个便宜但带着已被记录的负面作用的手法,比如把读者会用的词换成更生僻的词,栽在另一侧尾部的证据上,而不是栽在零结果上。而一个昂贵且测出零结果的手法应当停下,因为它真正的代价是你因此完全没去测的那个约束,而 Google 至今仍把自己的生成式功能描述为“根植于我们核心的搜索排序与质量系统”。6

还有一个性质,让边际手法的价值低于它测出来的数值。同一份基准报告说,随着候选集中采用同一方法的文档增多,总体收益会下降,“呈现出一种拥挤而零和的性质”。1 正结果是一项会折旧的资产,而一个真正回答了问题的页面不会。一个被正确读懂的零结果,不是浪费掉的一个季度。它是一张“你的约束不在这里”的地图,而它通常指向上游的检索与相关性,接下来由GEO 手法的证据综述相关性与排名那一篇接手。

本文的诚实边界

上面每一个数字都来自研究者自己搭的装置。两份基准都没有端到端地查询一个活的商业引擎,两者都自带检索,而它们的判定属于各自跑过的那些具体模型,所以“这个手法测出零结果”只有说成“它在那里、在那时测出零结果”才准确。C-SEO Bench 测的还是排名提升而不是引用,两者相关但不是同一个结果变量。提供方法学语言的那篇综述是预印本,而两个月重合度与重复运行的数字是经由它到达本页的。本文没有主张这些手法在你的域名上一文不值,它主张的是:已发表的这些测试本来就不可能看见小效应。

产品在哪里派得上用场,在哪里派不上

本页没有任何一件事需要软件。写下值得据此行动的最小效应、在测试之前把面板规模算好、留一批页面做对照、一次只改一件事,这些全都是免费的,而它们就是“读得懂的零结果”和“读不懂的零结果”之间的全部差别。软件提供的是底下那层重复测量:Bavior 按计划把一组固定的 prompt 打到五个引擎上,并记录每条答案引用了哪些来源,于是一次比较背后是一个分布,而不是一张截图。它不替你设计实验,不计算显著性,不改写你的页面,也无法告诉你某个手法在你的域名上是否有效。它的数字里出现零结果,那是测量里的零结果,不是世界里的零结果。免费 AI 可见性检测免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 30 日)。

出处,全部核查于 2026 年 8 月 30 日
  1. Puerto、Gubri、Green、Oh、Yun,《C-SEO Bench: Does Conversational SEO Work?》,NeurIPS 2025 数据集与基准赛道;十种方法,逾 1.9k 条查询;表 3 与 §6.2,右尾 Wilcoxon 符号秩检验并做 Holm-Bonferroni 校正:arxiv.org/abs/2506.11097
  2. Kim、Jeong、Kim、Lee、Lee,《SAGEO Arena》,已被 KDD 2026 接收,arXiv:2602.12187v2;171,003 份文档、2,700 条查询,表 2 的“只改正文”各列:arxiv.org/abs/2602.12187
  3. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(预印本);§11.2 与 §11.3:arxiv.org/abs/2607.14035
  4. Kirsten 等,Findings of ACL 2026;4,706 条查询;AI Overviews 两个月之间的页面重合度 18%,Google 自然结果 45%;温度为零时重复运行改变 9–28% 的决策;以上数字转述自出处 3 的 §6.2:aclanthology.org/2026.findings-acl.526
  5. Aggarwal 等,《GEO: Generative Engine Optimization》,KDD ’24,arXiv:2311.09735;后来两份基准所复测的十种策略中,有八种源自这里:arxiv.org/abs/2311.09735
  6. Google Search Central,《Google’s Guide to Optimizing for Generative AI Features on Google Search》,更新于 2026 年 7 月 10 日(第一方;“根植于”那一句):developers.google.com/search/docs/fundamentals/ai-optimization-guide
常见问题

你想知道的,都在这里。

零结果能证明某个内容手法没用吗?

不能。零结果说的是这次测试没能检出效应,而这取决于效应大小、方差和观测数量。要说某个手法毫无作用,你需要一个把所有“你本会据此行动的变化量”都排除在外的区间,而这比听上去更少见。没有这个区间时,诚实的结论是这次测试没有分辨率回答问题,而不是答案为否。

一次内容测试要多少观测,零结果才有意义?

要多到你结果周围的区间比“你会据此行动的最小变化”更窄。在 30 个观测时,95% Wilson 区间大约是正负 17 个百分点,所以比这更小的变化都是看不见的。给定效应量所需的样本量算法写在统计功效那篇里,产出这些观测的面板设计写在提示词与运行次数那篇里。

为什么负结果比零结果更有用?

因为它有方向,通常还有机制。SAGEO Arena 发现,只改正文的十种改写策略在检索、重排和引用三个环节全部下滑,并把检索端的损失归因于词汇错配:把常用词换成更生僻的词,会降低检索器打分所依赖的词面重合。零结果让你的先验原地不动;而许多策略上一致的符号会改变你下一步做什么。

测出零结果的事情,我该停掉吗?

请改用成本和风险来决定。如果它成本低、而且本来就有别的理由值得做,比如帮助真人读者的小标题和定义,那就继续做,只是别再为它宣称引用效果。如果它带着已被记录的负面作用,就砍掉。如果它很贵,就停,因为它真正的代价是你因此没去测的上游约束。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

一个读得懂的零结果,
胜过一个看不懂的数字。

免费试用