首页/学习 GEO/技巧有没有用
GEO 与 SEO · 证据

GEO 技巧到底有没有用?

有三项基准测试检验过这个问题,每一项都补回了上一项跳过的一个环节。按顺序读下来,它们讲的是同一个故事,而不是技巧清单讲的那个。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

有一些有用,但有条件,而且远小于技巧清单所暗示的幅度。2024 年那项为这个领域命名的 KDD 基准在一个合成引擎里测试了九种改写方法,被优化的文档本来就在模型的上下文里:最好的一种把自定义可见性指标从 19.3 提升到 27.2,而关键词堆砌只得到 17.7,低于什么都不做。1 这个领域自己 2026 年的批判性综述否定了“GEO 能提升 40% 可见性”这一泛化说法,称这个数字是“特定配置下、单一指标上的一个相对最大值”。4

要点速览
  • 那项开创性基准根本没测检索:被优化的页面本来就是交给模型的五份文档之一,所以它测的是固定上下文内部的归属。1
  • 两项把检索补回来的基准都发现效果缩小或反转:只改正文的优化,在 171,003 篇文档上让重排后前 10 位出现率下降 16%,最终引用率下降约 6%。3
  • 实测收益几乎全部流向起点低的来源:最强的三种方法让排名第一的来源份额下降 20% 到 30%,所以已经赢下这条查询的页面才是有东西可失去的那个。
开创性研究

那项开创性的 GEO 基准到底测了什么?

它测的是:一份本来就在模型上下文里的文档,能拿到生成答案中多少比例的文字归属,而不是这份文档有没有被检索到,也不是点击、排名或流量。

被测方法位置加权词数对照 19.3 基线
不做优化(基线)19.3不适用
关键词堆砌17.7比什么都不做还差
使用独特词汇20.5勉强
权威语气21.3小幅
易懂化22.0小幅
加入专业术语22.7小幅
标注出处24.6第四好
流畅度优化24.7第三好
加入统计数据25.2第二好
加入引文27.2九种里最好

引用这个结果的人几乎都不知道这个指标是什么。位置加权词数,指的是生成答案的全部字数中被归给你这个来源的比例,并按你的引用出现在答案中的位置做指数衰减折扣。它衡量的是“答案里有多少文字是你的”,不是“有没有人点击”。1 支撑这些数字的基准规模不小:来自九个公开来源、覆盖 25 个领域的 10,000 条查询,这让下一节讲的设计问题成为一个缺陷,而不是规模上的局限。

注意事项

为什么那个头条百分比并不是它被使用的那个意思?

那个头条数字,是一个自定义指标在一套人造装置里从 19.3 到 27.2 的相对距离,而这个领域自己 2026 年的综述否定了它:它把“GEO 能提升 40% 可见性”列入“作为泛化说法被否定”的主张,理由是这个数字是“特定配置下、单一指标上的一个相对最大值”。4 有三条注意事项与这个数字同行,却几乎从不被一并引用。

第一条是引擎。主实验并没有去查询 ChatGPT、Google 或 Bing:作者搭了一个合成引擎,先抓 Google 前五条结果,再让一个 2023 年代的模型基于这五个来源作答。1 第二条随之而来:被优化的页面本来就是那五份文档之一,所以检索环节根本不在测试范围内。综述对这个发现的评级正是如此:“一份已经被放进上下文的文档,能因果性地改变自己的排序、被引用或被使用”被评为高置信度,同时在同一行注明该证据“未涉及自然检索”。4 第三条就在同一张结果表里:关键词堆砌落在“什么都不做”的基线之下,是整组方法里唯一如此的一个;此后它在多项基准中被评为零效应或负效应。4

论文里另有两个细节能让这幅图更清楚。它的实机验证按作者自己的脚注只跑了 200 个样本,在那里最好的改写相对基线提升 21%,而关键词堆砌下降 9%。1 另外,该论文为“标注出处”这个方法给出的示例输出,把一个说法归到了一个看起来并不存在的研究机构头上,这意味着这个技巧在实现层面是“加上看起来像引用的文字”,而不是“加上真实的引用”。综述的警告值得记住:加入一个编造的统计数字可能提高被复用的概率,同时损害知识质量。4 引擎本身已经在大规模地错误归因:Tow 中心对八个引擎、1,600 条查询的审计发现超过 60% 返回了错误答案,所以一个“看起来像引用”的编造,是会不断累积的负债。6

再分配

当这些技巧真的起作用时,是谁在获益?

收益几乎全部流向起点低的来源:最强的三种方法让排名第五的来源可见度大约翻倍,同时让排名第一的来源份额下降 20–30%。

下表是按来源原始 Google 排名分列的可见度相对变化,取自同一篇论文的第二张表。

方法第 1 名第 2 名第 3 名第 4 名第 5 名
权威语气−6.0%+4.1%−0.6%+12.6%+6.1%
流畅度优化−2.0%+5.2%+3.6%−4.4%+2.2%
标注出处−30.3%+2.5%+20.4%+15.5%+115.1%
加入引文−22.9%−7.0%+3.5%+25.1%+99.7%
加入统计数据−20.6%−3.9%+8.1%+10.0%+97.9%

请把它读成再分配,而不是创造。这些改写并没有扩大“可供归属的答案文字”的总量;它们改变的是在一个固定候选集内部谁拿到归属,而这个机制把份额从原本领先者那里移向挑战者。于是这个技巧的价值就成了“你目前站在哪里”的函数:排在第一位时,激进的答案化改写是一项可测量的下行风险,而不是一次上行押注。

同一篇论文的第三张表补上了限定条件的另一半:最优方法取决于领域,“标注出处”在事实类与法律政务类查询上最强,“加入引文”在解释类与历史类上最强,“加入统计数据”在辩论类与观点类上最强。1 没有任何一种排序能跨领域成立,而这正是 2026 年那篇综述后来把“固定的格式配方”评为“泛化性很差”时所描述的性质。4

反转

把检索与重排补回来之后发生了什么?

两项把开创性论文跳过的环节补回来的基准,都发现效果缩小或反转。发表于 NeurIPS 2025 数据集与基准赛道的 C-SEO Bench,在逾 1.9k 条查询上跨六个领域测试了十种对话式 SEO 方法,报告称大多数此类方法“不仅在很大程度上无效,而且经常对文档排名产生负面影响”:54 个受测案例中只有 3 个显著为正,问答类中一个都没有;而在零售领域,把一个来源挪到上下文第一位,平均带来 2.77 位的排名提升,最好的改写方法只有 0.36 位。2 关于相关性与排名的姊妹篇对这项基准有详细展开。

真正把这条证据链收口的是 SAGEO Arena,因为它恢复了检索与重排,而不是提供一个固定上下文。在 171,003 篇文档、2,700 条查询上,它发现只改正文的优化让平均前 20 位出现率下降约 9%,重排后前 10 位出现率下降 16%,最终引用率下降约 6%。3 综述的解读是值得记住的那句话:一次改写可能在被塞进上下文之后表现良好,同时让这份文档在上游变得更难被检索、更缺乏竞争力。4

把三项结果并排放在一起,矛盾就消解了。开创性论文孤立地测量了管线的最后一个阶段,发现改写在那里有帮助;后来的工作测量了各阶段的复合结果,发现同样的改写在上游损失的比在下游获得的更多。这就是为什么实用规则是一条约束而不是一个技巧:绝不要以稀释页面与目标问题之间主题相关性的方式去优化正文。

综合

哪些技巧在三项研究里都活下来了?

有两个带着真实支撑活了下来,即真正的相关性和真实的可抽取证据,而固定配方、权威语气和关键词堆砌都没有。

下表的评级出自 2026 年那篇批判性综述本身,不是我们给的。

杠杆综述的评级基准测试补充了什么
查询与文档的相关性强(受控环境下)唯一一个胜过所有受测改写方法的杠杆
在上下文中的位置强(前提是已被检索)零售领域 2.77 位,最佳改写方法 0.36 位
可抽取的证据:数字、定义、对比中到强必须真实、有日期、有归因、且与意图匹配
时效、价格、明确日期中等一项 252,000 次试验的因子实验测到价格与近期日期有效应
文档结构中等且不一致去测试,不要预设效应方向
流畅度与简化弱到中等24.7 对 19.3 基线,仅在合成装置里
权威语气弱且不稳定21.3,且可能与可信度相冲突
固定的格式配方泛化性很差54 个受测案例中只有 3 个显著为正
关键词堆砌零效应或负效应17.7 对 19.3 基线;这个领域被复现最多的负面结论

那张表里有一行值得读两遍。“可抽取的证据”是唯一被 2026 年综述评为中到强的内容杠杆,而它的条件是硬约束而不是修饰:判断标准不是“加数字”,而是提供相关、可核实、有日期、且正确归因的证据。4 目前公开发表的唯一一份 AI 引用分类研究在描述层面指向同一方向:含有数字的页面平均影响力高出 61.6%,含有定义标记的高出 57.3%,同时作者明确提醒它无法区分因果与相关。7

有一个流行技巧没有出现在那张表里,因为证据指向相反的方向。“加 schema 标记能提高 AI 引用”被目前唯一一项配对对照测试所推翻:一项厂商研究把 1,885 个新增 JSON-LD 的页面与 4,000 个对照页面配对,在前后各 30 天的窗口内测量,发现 AI Overviews 的引用下降 4.6% 且统计显著,另外两个受测平台没有显著变化。11 Google 自己的文档也认同:出现在它的 AI 功能里不需要任何特殊的结构化数据。5 出于富媒体结果和机器可读性的理由上 schema,不要为它宣称更多。

测量

你要怎样在自己的站点上检验其中一个技巧?

不是靠一次前后对比的截图。三条发现支配着你的检验:答案会漂移,界面互相不一致,收益会随同行采用同一方法而衰减。

先固定“问什么”。一次编辑的效果必须放在引擎自身的方差之下来读,而 2026 年一篇统计学论文发现,许多表面上的差异落在测量本身的噪声基底之内,10 这足以让“改前问一次、改后问一次”变得毫无信息量。请固定一组 prompt,按计划重复地问,并记录每条答案引用了哪些来源,这样你比较的就是一个分布,而不是一张截图。

再固定“在哪里问”。SIGIR 2026 上一项 11,500 条查询的研究测得,同一家公司的三个答案界面之间 URL 层面的 Jaccard 相似度只有 0.11–0.18,9 这正是综述据以指出“可见性是按引擎和界面索引的”的依据。4 在一个界面上的结果不等于在其他界面上的结果;一个在某处奏效的技巧,是在一个引擎、一个领域、一个月份里奏效的。

最后,要预期答案会衰减。C-SEO Bench 发现,同一候选集中采用同一方法的文档越多,收益越小,2 所以本季度测出正效应的东西,是在“同行还没跟进”的条件下测出来的。全程有两件事值得保持不变:一次只改一个变量;以及守住页面的主题相关性。

本文的诚实边界

没有人在一个真实的商业引擎上做过端到端的受控实验。上面每一个结果都来自研究者自己搭的装置:开创性基准的引擎是合成的,且建立在一个 2023 年代的模型上;后来两项基准也都自带检索,而不是去查询一个生产系统。所以“排名压倒改写”是一个来自多方收敛证据的强推断,而不是任何人在真实环境中测出来的系数;给这一切打分的那篇综述本身是预印本,不过三项基准都已通过同行评议。请把否定性结论看得比肯定性结论更结实:被复现的是前者。

产品在哪里派得上用场,在哪里派不上

本页所有可执行的东西都是免费的,一个下午的编辑就能做完:让页面真正成为它所瞄准问题的最佳答案;在正文里放上真实、有日期、有归因的数字和平实的定义;别去动那些已经排第一的页面;把你找到的任何关键词堆砌段落删掉。这些都不涉及任何软件。软件真正改变的只有上面说的那件测量工作:Bavior 按计划把一组固定的 prompt 打到五个引擎上,并记录每条答案引用了哪些来源。它不提升你的排名,不改写你的页面,也无法承诺本页任何技巧会在你的域名上奏效。免费 AI 可见性检测免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 30 日)。

出处:全部核查于 2026 年 8 月 30 日
  1. Aggarwal 等,《GEO: Generative Engine Optimization》,KDD ’24(第 30 届 ACM SIGKDD,2024 年 8 月);GEO-bench,10,000 条查询,25 个领域。arxiv.org/abs/2311.09735
  2. Puerto 等,《C-SEO Bench: Does Conversational SEO Work?》,NeurIPS 2025 数据集与基准赛道;十种方法,逾 1.9k 条查询与 16k 篇文档,54 个受测案例。arxiv.org/abs/2506.11097
  3. Kim 等,《SAGEO Arena: A Realistic Environment for Evaluating Search-Augmented Generative Engine Optimization》,KDD 2026(arXiv:2602.12187v2,2026 年 8 月 7 日);171,003 篇文档,2,700 条查询。arxiv.org/abs/2602.12187
  4. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035;含置信度表与杠杆支撑度表。arxiv.org/abs/2607.14035
  5. Google Search Central,《AI features and your website》(无需特殊结构化数据;第一方文档)。developers.google.com/search/docs/appearance/ai-features
  6. Jaźwińska 与 Chandrasekar,《AI Search Has a Citation Problem》,哥伦比亚大学 Tow 数字新闻中心,2025 年 3 月 6 日;八个引擎、1,600 条查询。cjr.org
  7. Zhang、He 与 Yao,《From Citation Selection to Citation Absorption》,arXiv:2604.25707(预印本,仅描述性统计);602 条受控 prompt,21,143 条搜索层引用。arxiv.org/abs/2604.25707
  8. Vishwakarma 等,2026;252,000 次试验的因子实验,发现明确价格与近期日期存在效应,而仅改格式的效应很弱(见出处 4 的综述转述)
  9. Grossman 等,SIGIR 2026;11,500 条查询;Google 自然结果、AI Overviews 与 Gemini 之间 URL 层面的 Jaccard 为 0.11–0.18。arxiv.org/abs/2604.27790
  10. Sielinski,《Quantifying Uncertainty in AI Visibility》,2026 年 3 月,arXiv:2603.08924(预印本)。arxiv.org/abs/2603.08924
  11. 某厂商配对对照研究:1,885 个在 2025 年 8 月至 2026 年 3 月之间新增 JSON-LD 的页面,对照 4,000 个未新增的页面,在前后各 30 天窗口内测量引用,2026 年 5 月发布;AI Overviews 引用 −4.6%(显著),另外两个平台不显著。厂商发布;按本课程的出处规则,只转述不外链。
常见问题

你想知道的,都在这里。

那篇 GEO 论文里著名的“提升 40%”是真的吗?

它是一篇真实论文里的一个真实数字,而且不具备普适性,这正是 2026 年那篇批判性综述把它列入“作为泛化说法被否定”的原因。这个数字是某个自定义指标(位置加权词数,衡量答案文本中有多少被归给你的来源)从基线 19.3 到 27.2 的相对距离,测量环境是一个由五条 Google 结果加一个 2023 年代模型搭起来的合成引擎,而被优化的文档本来就在上下文里。引用它时必须带上这些条件,否则就别引用。

我该往页面里加统计数字和引文吗?

加真实的,带真实出处和真实日期,并且预期是中等而非戏剧性的效果。“可抽取的证据”是 2026 年那篇综述唯一评为中到强支撑的内容杠杆,而它的条件是硬性的:判断标准不是“加数字”,而是提供相关、可核实、有日期、且正确归因的证据。这个技巧诱发的失败模式,恰恰是那篇开创性论文自己的示例掉进去的那个:编造一个“看起来像引用”的出处,指向一个并不存在的机构。引擎核查不了,而读者终究会。

我的页面已经排第一,还需要为 AI 答案改写它吗?

在已经排第一的来源上,实测效果是负的,所以在那里请把激进的“答案化”改写视为下行风险。那篇开创性论文的分排名表格显示,标注出处、加入引语和加入统计数字这三种方法,会让排名第一的来源可见度下降 20–30%,同时让排名第五的来源大约翻倍;机制是在固定候选集内部的再分配,而不是增长。请为准确性、时效性和清晰度去编辑这些页面,把结构性的花招留给那些还没赢下这条查询的页面。

如果大多数技巧都没用,那还剩下什么可做?

三件事,按顺序:真正成为这个问题的最佳答案;赢得能把你放进检索上下文靠前位置的排名;以及在正文里放上真实、有日期、有归因的证据。这是 2026 年那篇综述评级高于“弱”的仅有几个杠杆,而前两件本就是普通的搜索工作,不是什么新东西。剩下的部分在站外:在商业类问题上,被引用的内容很大一部分是第三方报道和社区帖子,而不是任何厂商自己的页面,那是另一条预算线,也是另一个团队。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

这些基准测试都是公开的。
在买一份技巧清单之前,先把它们读了。

免费试用