首页/学习 GEO/相关性与排名
GEO 与 SEO · 专题

为什么相关性与排名主导着 AI 答案引擎?

因为这个领域规模最大的受控基准测试了 54 个“改写方法×领域”组合,只有 3 个显著为正、问答类中一个都没有;而单纯的上下文位置,价值是最好改写的好几倍。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

相关性与上下文位置之所以占主导,是因为它们是仅有的两个在模型动笔之前就起作用的杠杆,也是 2026 年批判性综述仅有的两个评为强支撑的杠杆。2 NeurIPS 2025 上的 C-SEO Bench 在超过 1.9k 条查询、16.3k 篇文档上,跨 6 个领域、2 项任务测试了 10 种改写方法:54 个“方法×领域”案例中只有 3 个显著为正,且都不在问答类里。1

要点速览
  • 综述只把两个杠杆评为强支撑,其余全都不是:查询与文档的相关性,以及在被检索上下文中的位置。2
  • 位置远胜文笔。在该基准的零售领域,把来源挪到上下文位置 1,平均把引用排名提升了 2.77 位,而最好的改写方法只有 0.36 位。1
  • 改写收益会随着对手照抄而衰减,基准把这个动态称为“拥挤且零和”。真正的相关性是对着查询评判的,不是对着其他文档。1
  • 只有一个内容杠杆撑得住中到强的支撑:可核实、有日期、有出处的证据。固定的格式配方泛化性差,关键词堆砌的得分甚至低于什么都不做。2
  • 不要去重构一个已经排第一的页面。被测到的效果是排名第一的来源可见度下降 20% 到 30%。3
基准测试

C-SEO Bench 究竟测了什么?

C-SEO Bench 测试了 10 种对话式 SEO 改写方法,跨 6 个领域、2 项任务,规模大到“若存在效应就能被检出”。

1.9k+条查询覆盖 6 个领域
16.3k篇文档问答与商品推荐两项任务
54个“方法×领域”案例10 种方法,6 个领域
3个显著为正问答类中一个都没有

C-SEO Bench 是一个用来检验“为生成式引擎改写文档到底有没有用”的基准,而它给出的答案基本是“没有”。它发表于 NeurIPS 2025 数据集与基准测试分会,覆盖问答与商品推荐两项任务、六个领域,代码与数据公开。1 它也是GEO 与 SEO这一阶段 整篇立论所围绕的那个结果。

摘要毫不含糊地陈述了结果:“大多数当前的 C-SEO 方法不仅在很大程度上无效,而且经常对文档排名产生负面影响,这与预期相反。相反,传统 SEO 策略,也就是那些旨在提升来源在 LLM 上下文中排序的策略,显著更有效。”论文自己对这个对比的总结是:把目标文档放到上下文窗口的第一位,“带来的引用排名收益,远大于任何 C-SEO 方法”。

有两个细节让这件事比通常的单次实验更难被打发掉。第一是广度。论文报告了 54 个“方法×领域”案例,足以让零星的胜出显形,而它的结论是“在 54 个案例中,我们只发现 3 个排名提升具有统计显著性”,问答任务上则没有任何方法有效。第二是失败的方向。好几种变换不只是没帮上忙,而是降低了文档的排序:“添加统计数字”在被测到的 24 个设置里,有 19 个让排名下降。1 一个中性的技巧只是便宜;一个负效应的技巧,则是你为读错一篇博客而缴的税。

机制

上下文位置为什么就是排名?

上下文位置正是排名转换成的东西,因为检索层输出的排序,会变成模型 prompt 里文档的顺序。答案引擎先检索出候选集,保留最靠前的几篇,把它们拼进上下文窗口,再从这个窗口生成文字。所以,凡是决定了候选集顺序的东西,也就决定了上下文的顺序。Google 自己的文档正是这样描述该机制的:检索增强生成的作用是“依靠我们核心的搜索排名与质量系统,从搜索索引中检索出相关且及时的网页,从而提升 AI 回答的质量、准确性与时效性”。5

这就是排名为什么是唯一一个“付一次赚两次”的杠杆。它先决定你是否在候选集里,然后决定你在里面坐在哪一位。Google 把入场条件说得很直白:要有资格出现在其生成式功能中,“页面必须已被收录,并且有资格带摘要出现在 Google 搜索中,满足搜索技术要求”。5 2026 年批判性综述把查询与文档的相关性评为受控环境下的强支撑,把上下文位置评为强支撑(前提是文档已被检索出来),除此之外没有任何一项被评为强。2 文献里的每一个内容技巧,都只作用于第二阶段,作用在一份已经赢下第一阶段的文档上。

有一条注意事项必须同时说出来,因为它经常被略去。C-SEO Bench 并没有去操纵一个线上搜索排名;它把“传统 SEO”操作化为“在自己的检索设置里把来源放到上下文位置 1”。所以这个发现对“它测了什么”是精确的:在上下文中排第一,远比写得更好值钱。而“某个具体的 SERP 提升能换来某个具体的引用增量”仍然是一个推断,不是一次测量。那样的研究尚未发表。

采用衰减

当所有人都用同一个改写技巧之后,收益会怎样?

一次改写带来的收益,会随着同一候选集里采用同一种改写的文档变多而缩小,而 C-SEO Bench 直接测到了这种衰减。该基准变动了“候选集中有多少文档用同一种方法做过优化”,发现“随着 C-SEO 采用者数量增加,整体收益下降,呈现出拥挤且零和的性质”。1 2026 年批判性综述把“竞争性采用侵蚀个体收益”列为中等置信度,是它那张“领域主要论断置信度”表上的三个中等条目之一。2

这就是“存量”和“流量”的区别,而它应该决定你的经常性预算流向哪里。真正的相关性是存量:一个页面若是某个问题的最佳答案,并不会因为竞争对手也变得相关而变得不那么相关,因为相关性是对着查询评判的,不是对着同场选手。格式技巧是流量:它们靠“让你的文档在候选集里显眼”起作用,也就意味着它们的价值下降速度,恰好等于其他文档采用它们的速度。

2024 年 KDD 那篇论文从另一头显示了同样的再分配。它的分排名表格里,表现最好的三种技巧会让已排第一的来源可见度下降,同时让排第五的来源大约翻倍:添加引用出处让排名第一的可见度变化 -30.3%、排名第五的变化 +115.1%,而添加引语和添加统计数字在排名第一处分别是 -22.9% 和 -20.6%,形状完全一致。3 这些技术并不创造答案份额;它们把份额从更强的来源挪到更弱的来源。如果你就是那个强来源,同一个技术对你就是成本。

另一半

这是不是说内容工作毫无价值?

不是,因为有一类内容工作具备中到强的支撑,而它恰好也是那类“让页面本身变得更好”的工作。批判性综述把“可抽取的证据”,也就是数字、定义、对比,评为中到强,前提是真实、有出处、且匹配意图。它给出的判据值得一字不改地引用:“判据因此不是‘加数字’,而是提供相关、可核实、有日期、且正确注明出处的证据。”2

没有支撑的是配方版本。固定的格式模板被评为“泛化性差”;权威语气弱且不稳定;关键词堆砌在多个基准上为零效应或负效应,在 KDD 那次实验里得分 17.7,而什么都不做的基线是 19.3,它是唯一一个落到基线以下的技巧。3

还有一种只有在测量整条管线时才会显形的组合风险。SAGEO Arena 在 171,003 篇文档、2,700 条查询上恢复了检索与重排,发现只优化正文会让平均前 20 位出现率下降约 9%、重排后前 10 位出现率下降 16%、最终引用率下降约 6%。4 综述的解读就是那条实用规则:一次改写“可能在被注入之后表现良好,同时让文档在上游更难被检索、更缺乏竞争力”。绝不要拿主题相关性去换可引用性。

估值

上下文里的头把交椅,究竟值多少?

它值“更大的答案份额”,而已发表的证据到此为止。批判性综述那张“领域主要论断置信度”表,把“引用得分能预测点击、转化或收入”放进了它使用的最低一档,也就是极低置信度,依据是“一个提示性的准实验和少量行业说法”,因果关系并未确立。2 从排名到上下文位置再到引用,这条链是可测的。而从一次引用到一次访问、再从一次访问到一个客户,这条链目前根本还没有被测过。

独立的行为数据显示,最后这一环就其自身而言也很薄。皮尤研究中心追踪了 2025 年 3 月的 68,879 次 Google 搜索,发现看到 AI 摘要的访问中有 8% 点击了传统搜索结果,而没有摘要的访问是 15%;点击摘要内部链接的比例只有 1%。6 拿下上下文里的头把交椅,换来的是“出现在一位多半不会点击的读者面前”。

由此有两个实际结论。一是用“有多少比例的答案点到你的名字”来衡量排名工作,而不是用预测流量,因为声量份额才是今天真正可测的变量。二是对已经标好价的结果主张保持怀疑:同一张表的最后一行,正是为业内还在重复的那个数字准备的,它把“GEO 让可见度提升 40%”记为“作为一般性论断予以驳回”,理由是该数字只是某个特定配置下、单一指标上的相对最大值。2 先去争排名,是因为它推动的是唯一一个被干净测量过的变量,而不是因为有人替你把结果标好了价。

应用

实际该按什么顺序做?

1. 真正成为这个问题的最佳答案

相关性是唯一一个被评为强支撑、又能由你这边推动的杠杆。选准那个具体问题,把它完整回答掉;不要为了多抓几条查询而把页面掺进相邻话题,因为那种稀释正是检索基准所惩罚的。

2. 争取那个能换来上下文位置的排名

一切常规 SEO 用来改善位置的做法,同时也是可得的最高杠杆的 GEO 工作,因为 Google 写明其 AI 界面依靠核心搜索排名系统。外链、内部结构和收录属于这里,而不是属于一条单独的 AI 工作流。

3. 加入可核实、有日期、有出处的证据

正文里要有真实的数字、真实的来源和真实的日期。这是唯一一个具备中到强支撑的内容杠杆;而综述说得很清楚:捏造的统计数字可能提高被复用率,同时摧毁别人复用你的理由。

4. 已经排第一的页面就别动

如果一个页面在其查询上已经排第一,激进的“答案化”改写被测到的效果是答案份额损失 20% 到 30%。对这些页面只做准确性和时效性的编辑;不要为了追一个你可能本来就拿得到的引用去重构它们。

本页诚实的局限

“位置对改写”的差距是我们自己算出来的比值,不是论文里写着的数字:C-SEO Bench 报告上下文位置 1 的平均排名提升为 2.77,最好的改写方法为 0.36,这是一个领域、一个模型上的结果,而论文用文字表述的是“远大于”,并没有给出倍数。“54 个里有 3 个显著为正”是一个统计显著性门槛,不是效应量,所以它告诉你的是“某方法多久能跑赢噪声”,而不是“赢多少”。C-SEO Bench 和这个领域几乎所有研究一样,是自备候选集、而非向线上商用引擎发起查询,所以它测的是它自己控制的检索之内的排序效应。没有人发表过这样一个受控实验:在真实引擎上移动一个真实页面的排名,然后测量其被引用率的变化。在那样的研究出现之前,“排名占主导”是一个由多源证据汇聚而成的强推断,而不是一个已被测定的系数。

产品在哪里派得上用场,在哪里派不上

本页的一切都不需要工具:读那篇基准论文,检查你的目标页面在它们所回答的问题上是否有排名,给还没有任何证据的页面补上有日期、有出处的证据,并且停止改写那些已经排在第一的页面。软件唯一能帮上忙的,是判断这些动作有没有改变答案,而且仅仅因为单次检查判断不了:Bavior 按计划把一组固定 prompt 打到五个引擎上,记录每个答案引用了哪些来源,于是变化会以“分布的改变”而不是“截图的改变”呈现出来。它不会改善排名,任何测量类产品都不会。从免费可见性检测开始;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 30 日)。

出处,全部核查于 2026 年 8 月 30 日
  1. Puerto、Gubri、Green、Oh、Yun,《C-SEO Bench: Does Conversational SEO Work?》,NeurIPS 2025 数据集与基准测试分会;2 项任务、6 个领域、超过 1.9k 条查询与 16.3k 篇文档、10 种方法、54 个“方法×领域”案例,代码与数据公开:arxiv.org/abs/2506.11097
  2. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(预印本);综述 45 项研究,表 4 为杠杆支撑度、表 5 为论断置信度:arxiv.org/abs/2607.14035
  3. Aggarwal、Murahari、Rajpurohit、Kalyan、Narasimhan、Deshpande,《GEO: Generative Engine Optimization》,KDD ’24;表 2 的分排名可见度变化与关键词堆砌结果:arxiv.org/abs/2311.09735
  4. Kim、Jeong、Kim、Lee、Lee,《SAGEO Arena: A Realistic Environment for Evaluating Search-Augmented Generative Engine Optimization》,KDD 2026(arXiv:2602.12187v2,2026 年 8 月 7 日);171,003 篇文档、2,700 条查询,恢复了检索与重排:arxiv.org/abs/2602.12187
  5. Google Search Central,《Optimizing your website for generative AI features on Google Search》,更新于 2026 年 7 月 10 日(第一方文档):developers.google.com/search/docs/fundamentals/ai-optimization-guide
  6. 皮尤研究中心,《Google users are less likely to click on links when an AI summary appears in the results》,2025 年 7 月 22 日;追踪 2025 年 3 月的 68,879 次搜索,点击率 8% 对 15%:pewresearch.org
常见问题

你想知道的,都在这里。

C-SEO Bench 是什么,它得出了什么结论?

C-SEO Bench 是 NeurIPS 2025 数据集与基准测试分会上发表的一个基准,用来测试“为生成式引擎改写文档”到底有没有用。它覆盖 2 项任务、6 个领域、超过 1.9k 条查询和 16.3k 篇文档,以及 10 种对话式 SEO 方法。论文报告了 54 个“方法×领域”案例,其中只有 3 个的排名提升具有统计显著性,而且都不在问答类里。摘要写道:大多数此类方法“不仅在很大程度上无效,而且经常对文档排名产生负面影响”,而传统排名工作“显著更有效”。

上下文位置真的比改写值好几倍吗?

在那个基准的零售领域里是的,而这个限定条件很重要。C-SEO Bench 报告:把来源挪到上下文位置 1,平均引用排名提升 2.77 位,而表现最好的对话式 SEO 方法是 0.36 位,在一个模型、一个领域上约为 7.7 比 1。论文本身并没有给出倍数,它的原话是:上下文位置 1“带来的引用排名收益,远大于任何 C-SEO 方法”。而且该基准是自备候选文档,而非向线上商用引擎发起查询,所以诚实的读法是:在上下文中排在最前面,远比写得更好值钱;而不是“某个具体的 SERP 提升能换来某个具体的引用增量”。

为什么 GEO 技巧会随时间失效?

因为它们争夺的是一个固定候选集内部的份额,所以价值会随采用率上升而下降。C-SEO Bench 变动了“一个候选集中有多少文档用了同一种方法优化”,发现“随着 C-SEO 采用者数量增加,整体收益下降,呈现出拥挤且零和的性质”。2026 年批判性综述把“竞争性采用侵蚀个体收益”评为中等置信度。真正的相关性则不同:它是对着查询而不是对着其他文档评判的,所以竞争对手变好并不会让你变得更不相关。

已经排第一的页面还要改写吗?

为了争取引用而改写就不要,因为被测到的效果是负的。KDD 2024 那篇 GEO 论文的分排名表格显示,表现最好的三种改写技巧会让已排第一的来源可见度下降 20% 到 30%,同时让排第五的来源大约翻倍。机制是再分配:这些技巧让排名靠后的来源更容易被引用,从而把答案份额从领先者那里拿走。对排第一的页面,只做准确性和时效性的编辑;把结构性改造的精力放到排在第三到第十的页面上。

既然排名占主导,还有哪种内容技巧值得做?

有一类值得,综述给它的评级是中到强:可抽取的证据,也就是数字、定义、对比,前提是真实、有出处、且匹配意图。它的判据写得很明确:“判据因此不是‘加数字’,而是提供相关、可核实、有日期、且正确注明出处的证据。”失效的是配方版本。固定的格式模板被评为泛化性差,权威语气弱且不稳定,而关键词堆砌在 KDD 实验里得分 17.7,低于什么都不做的 19.3 基线。

AI 答案里的一次引用能带来流量吗?

并不可靠,而且没有人证明过它可以。2026 年批判性综述把“引用得分能预测点击、转化或收入”放进了它的“极低置信度”一档,依据只有一个提示性的准实验和少量行业说法,因果关系并未确立。皮尤研究中心在 2025 年 3 月追踪了 68,879 次 Google 搜索,发现在出现 AI 摘要的访问中,用户点击传统搜索结果的比例是 8%,而没有摘要时是 15%;点击摘要内部链接的比例只有 1%。把一次引用当作“出现在读者面前的声量份额”,而不是当作你已经赚到的一次点击。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

先争排名,再谈改写。
两者都要按分布来测。

免费试用