AI 搜索如何工作 · 深入

AI 搜索管线的五个阶段是什么?

一个技巧可以赢下它被设计来赢的那一环,却依然输掉整个答案,因为各阶段是相乘的。这篇把管线从头到尾讲一遍,并给出一张把常见技巧按作用阶段归位的表。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

AI 搜索管线有五个阶段:理解、扇出、检索、选择与重排、合成与归因。它们是相乘而不是相加的,所以一个技巧可以赢下它被设计来赢的那一环,却依然输掉整个答案;而你只对最后三个阶段拥有输入。在唯一一项把五个阶段全跑了一遍的基准测试里(171,003 份文档、2,700 条查询),"只改正文"的改写取平均后把前 20 位检索出现率从 0.58 拉低到 0.53,把最终引用率从 0.50 拉低到 0.47。3

要点速览
  • 第一、第二阶段完全不读你发布的内容,所以任何号称能改善"引擎如何读问题"的服务,都是把后面阶段的工作贴错了标签。
  • 第三阶段是闸门,不是排序因子。Google 要求页面先"已被收录,并且有资格带摘要出现在 Google 搜索里",才谈得上成为支撑链接。1
  • 几乎所有有强证据支撑的东西都作用在第三阶段;几乎所有被当作 GEO 售卖的东西都作用在第五阶段,而 2026 年那篇批判性综述给第五阶段的评级是置信度。2
从头到尾

AI 搜索管线的五个阶段是什么?

这五个阶段是:理解、扇出、检索、选择与重排、合成与归因,并且按这个顺序运行。把每个阶段读成"它吃进什么、吐出什么":上一个阶段的输出,就是下一个阶段能拿到的全部宇宙。

1

理解

吃进你的消息和到目前为止的对话。吐出一个意图、一组已解析的实体、地区与时效之类的约束,以及一个"要不要搜索"的决定。

2

扇出

吃进那个意图。吐出跨子话题、跨数据源的若干条搜索查询。一个购买问题会悄悄变成关于成本、上手、替代方案和风险的多次搜索。

3

检索

吃进每一条生成的查询。为每条查询从索引或实时抓取中吐出一个候选集。未被收录、被屏蔽、已失效或抓不到的页面,从来就没进过这个集合。

4

选择与重排

吃进合并后的候选集。吐出一份塞得进上下文预算的、有序的段落短名单。单位是段落而不是页面,大多数候选在这里被丢掉。

5

合成与归因

吃进那份短名单。吐出答案正文,以及挂在其中部分论断上的链接。措辞与可引用性作用在这里,作用对象是已经熬过第四阶段的材料。

相乘的结果

你的可见性是这五个阶段的乘积,不是它们的和。2026 年一项基准测试把检索与重排两个阶段补回去之后,"只改正文"的改写平均丢掉了约 9% 的前 20 位出现率,而在下游什么也没赚到。3

着力点

你对哪些阶段拥有输入?

你对第三、四、五阶段拥有输入,对第一、二阶段则完全没有。理解发生在触碰任何文档之前,输入只有用户的措辞、对话历史和引擎自己的先验。扇出是引擎依据它自己对子话题的模型,从那个意图生成的。这两个阶段都不读你的站点,所以任何号称能改善它们的技巧,不是贴错了标签,就是空的。

在第三阶段,你的输入是收录、可抓取性和相关性。Google 对自己的界面直接写明了准入规则:页面"必须已被收录,并且有资格带摘要出现在 Google 搜索里,满足搜索的技术要求",并补充说,不需要任何特殊文件或 schema.org 标记才能出现。1 它的 AI 优化指引点明了这条规则背后的机制:检索增强生成之所以能改善答案,是"依靠我们核心的搜索排名系统,从我们的搜索索引中检索出相关且时效性好的网页"。6 在第四阶段,你的输入是段落结构,也就是某个具体子问题的答案是否坐落在一个可整块抬走的段落里。在第五阶段,你的输入是措辞。

还有很大一部分管线你完全没有输入,而它并不是一个阶段:它是别人的页面。第三和第四阶段跑在一个由整个网络构建的索引之上,所以在多数商业问题上,被检索出来的候选大多是第三方评测、榜单和讨论帖。2026 年一项覆盖四个品牌、跨三个引擎、共 47,097 条引用的厂商研究,把"被引用材料中品牌自有的比例"估在约 2%;四个品牌只能算示例而非常数,但量级本身就是重点。9

归位表

每一类 GEO 技巧作用在哪个阶段?

每一个常见技巧都只作用在一个阶段上,而它作用在哪个阶段,在你评估这个技巧本身之前,就已经决定了这条主张该拿多少分量。下表的证据评级用的是 Google 自己的准入文档和 2026 年那篇批判性综述的原始标签,不是我们的判断。12

阶段作用在这里的技巧类别证据对瞄准这里的主张该怎么处理
1 · 理解你发布的任何东西都不作用于此不适用直接否决。声称能改变引擎如何读问题的,不算建议。
2 · 扇出覆盖一个话题的各个子问题机制有第一方文档;效应量只有厂商数据去做,但不要给它配数字。
3 · 检索被收录、可抓取、服务端渲染;在该查询上有排名;关键词堆砌最强:第一方明示的准入要求;堆砌为零效应或负效应先做。它是之后一切的天花板。
4 · 选择与重排答案前置、自洽成段;真实、带日期、有出处的数字;标题层级、列表与表格已被检索后为强;结构为中等且异质其次做。测试结构,不要预设效应方向。
5 · 合成权威口吻、引用体措辞、跨领域照搬同一套固定配方弱且不稳定;泛化性差最后做,且仅在它不给上游带来代价时做。
不属于任何阶段额外的 AI 文本文件与特殊标记被引擎自己的文档否定6直接否决。这里没有可以动手的东西。

把这张表从上往下读,规律很清楚:几乎所有有强证据支撑的东西都坐落在第三阶段,而几乎所有被当作"GEO"售卖的东西都坐落在第五阶段。这不是巧合,因为第五阶段是文案不碰基础设施就能作用的唯一一个阶段。综述把"一份已经被放进上下文的文档能因果性地改变自己的排序、被引用或被使用"评为置信度,同时注明该证据"未涉及自然检索";把"一项白帽 GEO 干预能在多个引擎上持久改善自然可发现性"评为置信度。2 这两行就是这个领域证据基础的形状,也正是AI 搜索如何工作这一阶段先按阶段归位的原因。最后一行背后有第一方的裁定:Google 的指引把"LLMS.txt 文件和其他『特殊』标记"列入可以忽略的清单,理由是"Google 搜索本身并不使用它们"。6 最后一列才是实际用法:当有人向你推荐一个技巧、却说不出它作用在哪个阶段时,这个"说不出"本身就是答案。

相乘

为什么第五阶段的技巧会输在第三阶段?

第五阶段的技巧之所以会输在第三阶段,是因为一次让段落更可引用的改写,可能同时让页面对"本来会把它检索出来的那条查询"变得更不相关,而管线是把这两个效应相乘,不是相加。KDD 2026 的一项基准测试搭出了一个端到端环境:171,003 份文档、2,700 条查询,并把检索与重排重新纳入,共测试了十种"只改正文"的策略。取平均后,前 20 位出现率从 0.58 降到 0.53,重排后前 10 位出现率从 1.00 降到 0.84,引用率从 0.50 降到 0.47;最差的一种策略把前 20 位出现率压到 0.37,把引用率压到 0.39。3 综述的解读很精确:一次改写"可能在被注入之后表现良好,同时却让该文档在上游更难被检索、更没有竞争力"。2

另外两项基准从不同方向落到了同一个地方。NeurIPS 2025 数据集与基准赛道的一篇论文,在它自己描述为"超过 1.9k 条查询和 16k 份文档"的语料上"总共测试了十种方法",结论是这些方法"不仅在很大程度上无效,而且可能产生与预期相反的效果,拉低文档排序":"在 54 个案例中,我们只发现三例排序提升具有统计显著性",而问答任务上一例也没有。4 在"位置"这件事上它保持定性、不给倍数:把一份文档放到上下文窗口的第一位,"在 LLM 回答中带来的引用排名收益,远大于"它测过的任何一种内容改写方法。4 而开创这个领域的 2024 年 KDD 论文报告的收益要大得多,但那是一个自定义指标、一个专门搭建的两步引擎,而且被测页面本来就已经在那五份文档的上下文里;这正是综述把对该数字的流行推广称为"在某个特定配置下、某一个指标上的相对最大值"的原因。52 两个结论都诚实;但只有一个真正跑过检索这一步。《GEO 建议错在哪》把这两项基准完整拆开讲。

排序

这些工作该按什么顺序做?

按管线顺序来做,因为每一步都是下一步的闸门:先可检索性,再覆盖度,再段落结构,最后措辞。可检索性排第一,是因为它是闸门而不是排序因子。2026 年一篇预印本审计了生成式搜索引擎引用过的 26,266 条 URL,其中 27.1% 根本抓不下来:它们指向的是 PDF、图片等非文本格式,或者内容不可访问、已被删除。7 这还只是"已经好到被引用过"的那批页面的失败率。覆盖度排第二,因为扇出意味着:回答了四个子问题的页面在四个检索点上具备资格,只回答一个的页面只在一个点上具备资格。

段落结构排第三。选择作用于块:2026 年 7 月发布的一份厂商数据集覆盖 15,699,298 条 Google AI Mode 引用,其中 47.7% 被解析为指向具体段落的滚动定位高亮,而不是普通的页面链接;被高亮段落中位长度 117 词,约 85% 自洽。8 措辞排最后,而且要轻手轻脚,因为它是证据最弱的阶段,也是唯一一个改动可能让你在上游吃亏的阶段。

诊断

怎么判断是哪个阶段在失守?

把各阶段分开测量,因为一个混合出来的可见性数字没法告诉你是哪个阶段失守,而每个阶段的修法都是不同的人做的不同的活。综述把顺序讲得很直白:"做出一个相关、全面、可核查、结构清晰、且技术上可被检索的页面;然后分别测量检索、引用与保真度。"2

那项把完整管线恢复出来的基准测试为每种策略报告三个数字而不是一个:检索后进入前 20 的出现率、重排后进入前 10 的出现率,以及成稿答案里的引用率。这三个数字各走各的。给同一批文档加上结构化信息,平均前 20 位出现率从 0.58 升到 0.71,而引用率几乎没动,只从 0.50 变到 0.52。3 一个混合评分只会给你看到一个小小的正数,把这两件事同时藏起来。

创业者版本不需要任何仪器,一个下午就能做完。第三阶段:用普通请求抓一次页面,确认答案正文就在 HTML 里,再确认页面已被收录、有资格带摘要出现。1 第二与第三阶段:搜索你这个话题会扇出成的那些子问题,看你有没有东西排得上。第四阶段:读一读引擎从"被引用的那些人"那里摘走的段落。第五阶段:把那些措辞和你的对照。四项检查,四种不同的失守,而只有最后一种才是写作问题。

本文的诚实边界

五个阶段是一种分析上的切分,不是架构图。没有引擎公开过自己的管线,而且某些产品显然不是每个阶段各跑一次:深度研究模式和智能体模式明显会在动笔之前把扇出、检索与选择循环好几遍。这些边界是按"已发表证据的性质在哪里改变"划的,而不是按系统图会怎么划。请把这个模型当作给主张分类的工具,别当作规格说明。

产品在哪里派得上用场,在哪里派不上

Bavior 只帮你处理这套诊断里会反复重来的那部分。它按计划把一组固定的 prompt 打到五个引擎上,并记录每条答案引用了哪些来源,让你把第三、第四阶段的结果看成一个分布而不是一张截图;当被引用的来源是讨论帖时,它会用你掌控的账号起草回复,在任何内容发出之前由你审批。它不爬你的站点,不替你修可检索性,也不能承诺一次引用:上面那四项手工检查,无论如何都还是你自己的活。免费 AI 可见性检测免费 GEO 体检无需付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 29 日)。

出处,全部核查于 2026 年 8 月 30 日
  1. Google Search Central,《AI features and your website》(查询扇出、准入条件、无需特殊标记;第一方文档;更新于 2025 年 12 月 10 日):developers.google.com/search/docs/appearance/ai-features
  2. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(综述预印本):arxiv.org/abs/2607.14035
  3. Kim、Jeong、Kim、Lee、Lee,《SAGEO Arena: A Realistic Environment for Evaluating Search-Augmented Generative Engine Optimization》,KDD 2026,arXiv:2602.12187v2(2026 年 8 月 7 日修订);171,003 份文档、2,700 条查询;分阶段数字取自表 2:arxiv.org/abs/2602.12187
  4. Puerto、Gubri、Green、Oh、Yun,《C-SEO Bench: Does Conversational SEO Work?》,NeurIPS 2025 数据集与基准赛道,arXiv:2506.11097;在"超过 1.9k 条查询和 16k 份文档"上测试十种方法:arxiv.org/abs/2506.11097
  5. Aggarwal 等,《GEO: Generative Engine Optimization》,KDD 2024,arXiv:2311.09735:arxiv.org/abs/2311.09735
  6. Google Search Central,《Google’s Guide to Optimizing for Generative AI Features on Google Search》(RAG 依赖搜索索引;LLMS.txt 不被使用;第一方文档;更新于 2026 年 7 月 10 日):developers.google.com/search/docs/fundamentals/ai-optimization-guide
  7. Allaham 与 Diakopoulos,《Synthetic Sources?: Auditing Generative Search Engine Citations for Evidence of AI-Generated Sources》,2026 年 5 月 22 日,arXiv:2605.23684(预印本);26,266 条被引用 URL,其中 19,154 条(72.9%)成功抓取:arxiv.org/abs/2605.23684
  8. 段落抽取数据集,2026 年 7 月:15,699,298 条 Google AI Mode 引用,覆盖 148 个行业、460 万个唯一高亮段落、270 万个页面;47.7% 为滚动定位高亮,段落中位数 117 词,约 85% 自洽。厂商发布;按本课程的出处规则,只描述、不链接。
  9. 内容时效研究,2026 年 7 月:7,683 个页面、47,097 条引用、三个引擎、四个品牌,2026 年 3 至 6 月;关于这些品牌的被引页面中,品牌自有的约占 2%。厂商发布;按本课程的出处规则,只描述、不链接。
常见问题

你想知道的,都在这里。

AI 搜索管线里我该先修哪个阶段?

先修检索,因为它是一道闸门而不是一个排序因子:一个无法被收录或抓取的页面,在后面每个阶段都是零分,写得多好都一样。先确认页面已被收录、用普通 HTTP 抓取(不跑 JavaScript)就能返回正文、没有对该引擎的搜索爬虫设限,并且确实与有人会发出的某条查询相关。之后再做段落结构,最后才做措辞:措辞是证据最弱的阶段,也是唯一一个改动可能让你在上游吃亏的阶段。

五阶段模型就是引擎真实的搭建方式吗?

没有任何引擎公开过自己的管线,所以五阶段模型是推断出来的,不是有文档依据的。它由三部分拼成:关于单个步骤的第一方表述(Google 在自己的文档里描述了查询扇出,也写明了收录要求)、在公开环境里重建检索与重排的学术基准,以及黑盒审计。它对观测行为的预测足够好,够用来按机制给主张分类。但它不是规格说明,而且深度研究模式明显会把中间几个阶段循环跑好几遍,而不是各跑一次。

改写页面会让我的 AI 可见性变差吗?

会,而且已经被测出来了。KDD 2026 的一项基准测试把检索与重排重新纳入,覆盖 171,003 份文档与 2,700 条查询,测了十种"只改正文"的策略;取平均后,前 20 位出现率从 0.58 降到 0.53,重排后前 10 位出现率从 1.00 降到 0.84,引用率从 0.50 降到 0.47,而最差的一种策略把前 20 位出现率压到 0.37。机制在于,为"可引用性"调过的改写,可能稀释掉当初让页面被检索到的主题相关性。另一项 NeurIPS 2025 的基准测试则写道,这类方法"不仅在很大程度上无效,而且可能产生与预期相反的效果,拉低文档排序"。

AI 搜索里哪些阶段我完全影响不了?

第一和第二阶段,也就是理解与扇出,不接收来自你站点的任何输入。理解发生在触碰任何文档之前,只用到用户的措辞、对话历史和引擎自己的先验。扇出是引擎依据它对该话题子话题的内部模型、从那个意图生成的。两者都不读你的页面,所以你发布的任何东西都动不了它们;任何号称能改善这两个阶段的服务,要么是把后面阶段的工作贴错了标签,要么是空的。面对这个约束,有用的回应是刻意挑选你的测量 prompt,因为 prompt 是你唯一能控制的第一阶段输入。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

五个阶段,只有一个在失守。
先找出是哪一个。

免费试用