首页/学习 GEO/诊断法
AI 搜索如何工作 · 诊断法

为什么这么多 GEO 建议是错的?

四个问题,几乎能把这个领域里的任何一条主张分进三堆:“有支撑”“测量时跳过了最难的那部分”“没有机制”。下面就是这四个问题,以及它们赖以成立的那些结果。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

大多数 GEO 建议之所以出错,是因为它作用在管线的最后一个阶段,而测量它的那个环境里,前面四个阶段是关掉的。给任何一条主张归位,只要问两件事:它作用在哪个阶段,以及有人测量它的时候检索在不在跑。一项被 KDD 2026 接收的基准测试在 171,003 份文档上把检索与重排重新纳入,发现只改正文的优化把平均前 20 位出现率降低 9%、最终引用率降低 6%。1

关键要点
  • 先问这个技巧作用在五个管线阶段中的哪一个。理解与扇出根本不接收来自你站点的任何输入,作用在那里的技巧没有机制可走。
  • 再问测量这个效应的时候,检索与重排在不在跑。把文档先放进模型上下文的研究,说不了这个页面本来会不会被检索到。
  • 还要问这个技巧是给谁用的。在那篇开山论文自己的表里,最强的三种改写让已经排第一的来源损失 20% 到 30% 的可见度,同时让排第五的来源大约翻倍。2
根因

为什么这么多 GEO 建议是错的?

因为最容易下手的那个阶段,恰好也是最容易被单独测量的那个阶段,而这两件事叠加起来长出了一个行业。改写一个页面,一个人一个下午就能做完,不用碰基础设施,所以建议都挤到了那里。测量一次改写也很容易:把一组固定文档递给模型,只改措辞,所以早期实验也挤到了那里。结果是:一大批关于“已经在模型上下文里的文档会怎样”的真实发现,被推广成了关于“开放网络上的页面会怎样”的主张。

2026 年那篇领域批判性综述在自己的置信度表里画出了这条线。“一份已经被放进上下文的文档能因果性地改变自己的排序、被引用或被使用”评为置信度,并注明该证据“未涉及自然检索”。“一项白帽干预能在多个引擎上持久改善自然可发现性”评为。“引用分数能预测点击、转化或收入”评为极低3 这个领域里几乎每一次失望,都住在第一行与另外两行之间的那道缝里。这套诊断法据以归位的那条管线,就是AI 搜索如何工作这一阶段

诊断法

怎么把一条 GEO 主张按它作用的阶段归类?

给一条 GEO 主张分类的办法,是问它作用在五个管线阶段中的哪一个、在那个阶段你拥有的东西算不算输入、这个效应有什么证据,以及效应量有多大。

按顺序问这四个问题。大多数主张在第一或第二问就停住了。

01

它作用在哪个阶段?

如果诚实的答案是理解或扇出,那就没有机制:这两个阶段在触碰任何文档之前就跑完了,也不接收来自你站点的输入。如果答案是检索,那里证据最强。如果是合成,那里证据最弱,而且这个技巧可能让你在上游吃亏。

02

测量它的时候,前面的阶段在跑吗?

如果那项研究是把文档先放进模型上下文、然后只改措辞,那么结果是真的,但它说不了“这个页面本来会不会被检索到”。就是这一个设计选择,把这个领域里乐观的结果和悲观的结果分了开来。

03

分母是什么,日期是什么?

在这个领域,没有这两样,一个百分比就读不懂。同一份数据上,按答案统计和按引用统计的份额能差出几十个百分点;而这些系统每月都在变:2025 年某个引擎对某个大型论坛的引用率,在一个月内移动了大约 50 个百分点。

04

等所有人都这么做了,它还有效吗?

NeurIPS 2025 的一项基准测试发现,随着采用率上升收益会下降,并把这个问题形容为“拥挤且零和”。4 任何因为做的人少才有效的东西都有保质期,而你正在读的建议本身,会把到期日提前。

反转

那项端到端基准测试到底测出了什么?

这项端到端基准测出的是:那些在“文档已在上下文里”时能赢的改写,可能让文档丢掉进入上下文的资格。一篇被 KDD 2026 接收的论文搭建了一个由 171,003 份文档和 2,700 条查询组成的环境,把检索与重排重新纳入,而不是像早期基准那样预先固定候选集;测得只改正文的优化把平均前 20 位出现率降低约 9%,重排后前 10 位出现率降低 16%,最终引用率降低约 6%。把一个自动优化器只用在正文上,损失更大。1

2026 年那篇批判性综述的解读没有选边站,而是把与 KDD 2024 结果的表面矛盾化解掉了:一次改写“可能在被注入之后表现良好,同时却让该文档在上游更难被检索、更没有竞争力”。3 两组数字都是对不同东西的诚实测量,而你实际经历的是它们相乘的结果。

也要把它没证明的东西说准。它是单一一项基准,已被 KDD 2026 接收,由一个团队搭建。它测的是“只改正文”的优化,不是所有可能的干预。而一个受控语料库也不是实时的网络。它确立的东西更窄,却依然决定性:一个只在检索之后被评估过的内容技巧,等于没有被评估过;而至少有一次,当有人真的去查的时候,总账是负的。

第一名惩罚

如果我已经排第一,GEO 技巧会伤到我吗?

会。在 KDD 2024 的结果里,表现最好的三种改写技巧让已经排第一的来源可见度下降 20–30%,同时让排第五的来源大约翻倍;也就是说,同一个技巧对挑战者是收益,对领先者是成本。

下表是按来源原本的 Google 排名分组的相对可见性变化,出自 KDD 2024 论文自己的结果表。几乎没人引用这张表。2

改写技巧若该来源原本排第一若它原本排第五
添加出处−30.3%+115.1%
添加引语−22.9%+99.7%
添加统计−20.6%+97.9%
权威口吻−6.0%+6.1%
流畅度优化−2.0%+2.2%

这些技巧是把答案份额向排名更低的来源再分配,而不是凭空创造可见性。这让它们成为一种拉平效应而不是普遍提升,也改变了“谁该采用它们”。如果你是排在第五位的挑战者,这份测量里的上行空间很大。如果你已经拥有某条查询的第一名结果,那么激进改写就是在你最好的资产上冒下行风险,而这句话是同一篇论文的数字说的。

实用规则很不性感:在你尚未占优的页面上做测试;把改动控制在可回退的幅度内;分别测量“出现”和“被引用”,并用多次重复运行,而不是把一次前后截图当成结果。

清点

哪些流行说法直接过不了这道测试?

最常被重复的四条 GEO 主张直接通不过阶段测试:一个作为标题的百分比涨幅、某个单一平台在全部 AI 引用中的占比、把 schema 标记当作引用杠杆,以及把 llms.txt 当作可见性文件。下面把每一条连同它的更正一起完整列出。

过不了阶段测试

  • “GEO 能把可见性提升 40%”被 2026 年那篇批判性综述作为一般性主张否定:它只是某一个指标、某一种配置下、且页面已在上下文中的相对最大值
  • “加 schema 标记能增加 AI 引用”不成立:现有唯一一项配对对照测试(1,885 个页面对 4,000 个对照页)测得 AI Overviews −4.6%,而 Google 明说不需要任何特殊的 schema.org 数据
  • “发布一个 AI 文本文件好让引擎找到你”不成立:Google 明说搜索本身并不使用这类文件,而一项覆盖 137,210 个域名的研究发现其中 97% 收到过零次请求
  • “某个论坛占 AI 引用的 40.1%”可以追溯到一张“每条回答出现率”的图,图上公布的数值加起来约为 208%;它们从来就不是份额
  • “X% 的 AI 引用来自自然结果前十”:没有分母和日期就读不懂;已发表的数字从约六分之一到四分之三以上都有
  • “没有 AI 爬虫渲染 JavaScript”属于单一来源,出自 2024 年 12 月的一份日志研究,从未被复现;而且对 Google、Applebot 和智能体浏览器来说是错的
  • “按 AI 的关键词优化页面”不成立:关键词堆砌是 KDD 2024 结果里唯一一个得分低于“什么都不做”的技巧

过得了阶段测试

  • 被收录、且可带摘要展示:引擎自己写明的要求,第 3 阶段
  • 不跑 JavaScript 也能返回正文:免费,并消除第 3 阶段一个因引擎而异的风险
  • 核对搜索机器人令牌,而不是训练令牌:每家厂商都在文档里做了拆分
  • 对某个真实的子问题确实相关:综述里最强的杠杆
  • 在第一句就把那个子问题答掉,且自洽成段:第 4 阶段
  • 在正文里放真实、带日期、有出处的数字和平实的定义:第 4 与第 5 阶段
  • 按引擎分别报告、多次重复运行,并把检索、引用与准确性分开测
剩下的东西

什么留了下来?

留下来的是一份简短乏味的清单,2026 年那篇批判性综述用一句话说完了:“做出一个相关、全面、可核查、结构清晰、且技术上可被检索的页面;然后分别测量检索、引用与保真度。”3 这句话每个词都在干活。相关,是第三阶段。全面,是第二阶段,因为扇出是按子问题检索的。可核查与结构清晰,是第四阶段。技术上可被检索,是横在这一切前面的那道闸。而把三种结果分开测量,是防止你花整整一个季度去优化错的那一个。

Google 自己的文档说了一件兼容的、甚至更短的事,而当某个厂商告诉你别的说法时,这句话值得握在手里:要作为支持链接出现在它的 AI 功能里,“页面必须已被收录,并且有资格带摘要出现在 Google 搜索里,满足搜索的技术要求”,而且“你不需要为了出现在这些功能里而创建新的机器可读文件、AI 文本文件或标记”。5 任何在这条线之上兜售的东西,都应当说得出它作用在哪个阶段,以及是哪项研究在那个阶段测过它。

本文的诚实边界

这套诊断法按机制给主张分类,不是按它们是否为真。一条主张可以点对了阶段却依然是错的;一条主张也可以过不了这道测试,却依然描述了某种真实但还没人好好测过的东西,因为在一个这么年轻的领域里,“没有证据”只是很弱的“证据表明没有”。上面有两条辟谣本身依赖单一研究,而这正是它们所批评的毛病:schema 的结论是一次配对对照测试,对象还是本来就被大量引用的页面;JavaScript 的结论是 2024 年 12 月的一份日志研究。这些系统还每月都在变,所以一个带日期的零结果,只是那个日期上的零结果。这里超过六个月的任何东西,动手之前请重新核一遍。

产品在哪里派得上用场,在哪里派不上

诊断法本身就是交付物,而且免费:把你最近收到的五条 GEO 建议拿出来,在每一条旁边写上它作用的阶段编号,然后把说不出阶段的那些删掉。接着把幸存下来的那些,当作小而可回退的实验,跑在你尚未占优的页面上,并用多次重复运行而不是一张截图来衡量。Bavior 只在最后这个测量问题上帮忙:它按计划把一组固定的 prompt 打到五个引擎上,并记录每条答案引用了哪些来源,好让一次改动表现为分布的移动而不是一则轶事;当被引用的来源是一条活跃的讨论帖时,它会用你掌控的账号起草回复,在任何内容发出之前由你审批。它不替你审计 GEO 建议,不改写页面,也不能承诺引用或排名。免费 AI 可见性检测免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 29 日)。

出处:全部核查于 2026 年 8 月 29 日
  1. Kim 等,《SAGEO Arena: A Realistic Environment for Evaluating Search-Augmented Generative Engine Optimization》,KDD 2026,arXiv:2602.12187。arxiv.org/abs/2602.12187
  2. Aggarwal、Murahari、Rajpurohit、Kalyan、Narasimhan、Deshpande,《GEO: Generative Engine Optimization》,KDD 2024,arXiv:2311.09735(按原始排名分组的相对变化,以及关键词堆砌的结果)。arxiv.org/abs/2311.09735
  3. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(置信度表,以及对 40% 推广说法的否定)。arxiv.org/abs/2607.14035
  4. Puerto、Gubri、Green、Oh、Yun,《C-SEO Bench: Does Conversational SEO Work?》,NeurIPS 2025 数据集与基准赛道,arXiv:2506.11097。arxiv.org/abs/2506.11097
  5. Google Search Central(第一方文档)。《AI features and your website》,最后更新 2025 年 12 月 10 日,本文两处引文均出自该页:developers.google.com/search/docs/appearance/ai-features。《Optimizing your website for generative AI features on Google Search》,最后更新 2026 年 7 月 10 日:developers.google.com/search/docs/fundamentals/ai-optimization-guide
  6. 结构化数据配对对照研究,2026 年 5 月:1,885 个在 2025 年 8 月至 2026 年 3 月间新增 JSON-LD 的页面,对照 4,000 个对照页,测量前后各 30 天的引用;AI Overviews −4.6%(显著),其他界面不显著。厂商发布;按本课程的出处规则,只描述、不链接。
  7. AI 文本文件研究,2026 年 6 月:137,210 个域名;其中 97% 的此类文件收到过零次请求,且没有机器人去探测并不存在的此类文件。厂商发布;按本课程的出处规则,只描述、不链接。
  8. 最常被引用域名研究,2025 年 11 月:230,000 条 prompt、超过 1 亿条引用,2025 年 7 月至 10 月;某个引擎对某个大型论坛的引用率在一个月内移动了约 50 个百分点,而被广泛引用的那个 40.1% 数字可追溯到一组加起来约 208% 的“每条回答出现率”。厂商发布;按本课程的出处规则,只描述、不链接。
常见问题

你想知道的,都在这里。

“GEO 能把可见性提升 40%”这个说法成立吗?

2026 年那篇领域批判性综述把它作为一般性主张否定了,理由是这个数字只是“在某个特定配置下、某一个指标上的相对最大值”。其背后的结果是“位置加权词数”从 19.3 升到 27.2,这个指标衡量的是答案中有多少词被记到你的来源名下,而它发生在一个专门搭建的引擎里:抓取 Google 前五条结果,让 GPT-3.5 基于它们写作,被优化的页面本来就在这五份之中。它是对某一个阶段的真实测量,但不是对“一次改写会给开放网络上的页面带来什么”的预测。

加 schema 标记能让 AI 搜索更多地引用我吗?

现有唯一一项配对对照测试说不能,而引擎自己的文档也同意。那项研究跟踪了 2025 年 8 月至 2026 年 3 月间新增 JSON-LD 的 1,885 个页面,对照 4,000 个从未添加的页面,测量前后各 30 天的引用,发现 AI Overview 引用下降 4.6%,其他界面无显著变化。Google 直接写明,要出现在它的 AI 功能里,“也没有什么特殊的 schema.org 结构化数据是你必须添加的”。为富媒体结果和机器可读性卫生而上 schema;别把它当成 AI 引用的杠杆。

如果我已经排在第一,还该对那个页面做 GEO 改写吗?

要小心。那篇开山论文自己的结果表显示,这些技巧会明显降低“已经排第一的来源”在答案中被记到的份额:添加出处 −30.3%、添加引语 −22.9%、添加统计 −20.6%;而对排第五的来源大约是翻倍。这些技巧是把答案份额向排名更低的来源再分配,所以它是一种拉平效应,不是普遍提升。请在你尚未占优的页面上做测试,把改动控制在可回退的幅度内,并用多次重复运行去衡量,而不是看一次前后对比。

怎么判断一项 GEO 研究值不值得照做?

按顺序问四个问题。这条主张作用在管线的哪个阶段?如果是理解或扇出,那就没有机制,因为这两个阶段不接收来自你站点的输入。测量时检索与重排在跑吗,还是文档被预先放进了模型的上下文。分母是什么、日期是什么:按答案统计和按引用统计的份额能差出几十个百分点,而这些系统每月都在变。以及这个效应在被广泛采用后还在不在:NeurIPS 2025 的一项基准测试发现,随着更多人采用同一技巧,收益会下降,并把这个问题称为“拥挤且零和”。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

说不出作用在哪一阶段,就把那个技巧丢掉。
然后去测量究竟什么动了。

免费试用