首页/学习 GEO/第 4 阶段
AI 搜索如何工作 · 第 4 阶段

选择与重排是怎么决定一条 AI 答案用哪些段落的?

这是悄悄杀死大部分内容工作的阶段,因为被评判的不是你发布的那个页面,而是重排器能从中抬走的、大约一百词的一个块。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

选择与重排,是 AI 引擎把每条扇出子查询返回的候选集合并起来、去掉重复、按“每个段落对那条具体问题回答得多好”重新排序,并把名单裁到塞得进模型上下文预算为止的那个阶段。被打分的单位是段落而不是页面,所以一个很好的页面,如果真正的答案在第九段,在这里参赛的身份就是一个平庸的段落。在 2026 年 7 月发布的一份覆盖 15,699,298 条 Google AI Mode 引用的厂商数据集中,有 47.7% 解析为指向某个具体段落的滚动定位高亮,而不是普通的页面链接,被高亮段落的中位长度为 117 词。1

关键要点
  • 四个操作依次发生:合并候选集、折叠近似重复、按“每个段落对子问题回答得多好”重排,然后裁到上下文预算。只有熬过这一刀的东西,才会抵达书写阶段。
  • 这里被打分的不是域名权威度,所以弱站点上写得清楚的答案,可以赢过强站点上被埋起来的答案。权威度早在检索阶段就已经起完作用了。
  • 段落在模型上下文里的位置是被记录得最扎实的杠杆,而你无法直接设定它:在 NeurIPS 2025 的一项基准测试(GPT-4o-mini)中,改善来源的上下文位置在零售领域带来平均 2.77 个名次的提升,而最好的内容改写只有 0.36。5
  • 所有有文档依据的控制手段都是做减法的。Google 点名了 nosnippetdata-nosnippetmax-snippetnoindex;没有任何引擎让你提名一个首选段落。6
定义

选择与重排阶段发生了什么?

选择与重排把若干份候选名单变成一份简短、有序、塞得进固定上下文预算的证据清单。依次发生四个操作:把各条扇出子查询返回的候选集合并;把近似重复与转载副本折叠掉,免得同一个论断占掉三个名额;把剩下的按“某个模型对该段落回答这条具体问题的程度”打分重排,而不是按它域名有多权威;然后从尾部裁掉,直到证据装得下。Google 用第一方语言描述了同一个形状:接地(grounding)“依靠我们核心的搜索排名系统”检索网页,之后“我们的系统再审阅那些被检索到的页面中的具体信息,以生成更可靠、更有帮助的回答”。9 这一步“审阅”,就是第四阶段。

是一个模型在阅读这些段落,而不是某个作用在链接图上的公式,这一点并不是对封闭系统的猜测。它就是这个阶段依赖的、已发表的技术:EMNLP 2023 的一项研究发现,被恰当指令化的语言模型用作重排代理时,“能在常用的信息检索基准上给出与最先进的有监督方法相当、甚至更好的结果”。10 重排器是一个读者,而它读的是块。

被低估的是“裁掉”这一步。上游产出的候选是几百上千条;抵达书写阶段的只有屈指可数的几条。在 2026 年 4 月发表的一份 602 条 prompt 的学术样本里,一条成品答案上挂的引用数平均为:ChatGPT 6.88 个,Google 的 AI 界面 12.06 个,Perplexity 16.35 个。3 候选池的绝大部分都在这里被丢掉了,而被丢掉的东西无法靠下游更好的文笔捞回来。这个阶段在整条管线里的位置,见AI 搜索如何工作这一阶段

竞争单位

为什么单位是段落而不是页面?

单位之所以是段落,是因为 Google AI Mode 的引用里有 47.7% 指向的是一段被高亮的具体文字,而不是整个页面;这段高亮文字的中位长度是 117 词。

数据来自一份为期一年的厂商数据集:15,699,298 条 Google AI Mode 引用,覆盖 148 个行业,2026 年 7 月发布。1

47.7%的引用是段落高亮而不是普通页面链接
117词,被高亮段落的中位长度大致是一个紧凑的段落
85%的段落是自洽的没有上下文也读得懂
48%的“被反复引用段落”以问句开头一次性段落中只有 22%

当引擎引用一个滚动定位高亮时,它是在 URL 里直接告诉你它选中了哪些字,而这是目前存在的、最接近“公开窥见第四阶段”的东西。同一份数据集还发现:80% 被抽走的段落把答案放在第一句;80.9% 的段落只被引用过一次,而约 2,300 个段落被复用了 61 次以上;被回收最多的那一个段落被引用了 661 次。1 真正在竞争的不是页面,是段落,而一个好段落可以被复用几百次。

有两条注意事项跟着这些数字。它们是描述性的,不是因果性的。还有一个该研究没有解决的基准率问题:它报告了“被抽走的段落中有多大比例是答案前置的”,却没有报告“全网所有段落中有多大比例是这样的”,所以“80% 被抽走的段落是答案前置的”并不能证明答案前置导致被抽走。请把它当作对一个说得通的机制的佐证,而不是一个被测出来的增幅。

稀释

被埋起来的答案为什么会输?

被埋起来的答案会输,是因为重排器打分的对象是那个块,而围着你答案的那八段并不是它的证据,它们是它周围的噪声。一个 3,000 词的页面,如果答案在第九段,它呈现的就是“一个相关段落嵌在一大堆讲相邻话题的材料里”。而一个更短的页面,如果第二句就把问题答了,它呈现的是一个几乎全在靶心上的段落。页面级权威救不了前者,因为这里被打分的根本不是权威。

段落在页面中的位置看起来也有影响,尽管证据是厂商发布并自我声明为相关性质的。2026 年 6 月一项针对 10,000 条 AI Overview 回答、100,000 个引用落点、通过滚动定位片段匹配到原文位置的研究发现,38% 的引用取自页面的前 100 词,而一年前一个更小的对照集里是 20%;作者明确写道,这份数据是相关性质的,他们“能展示 AI 模型从哪里引用,但不能确定地说明为什么”。2 实用的读法不是“把所有东西都堆到顶部”,而是:开场白、品牌清嗓子和“本文将介绍……”占据了整页最值钱的地段。

一个段落被选中之后,它在模型上下文里的位置同样有影响,而且这方面的证据比任何关于页面形态的证据都强。2026 年那篇批判性综述把“上下文中的位置”评为(前提是该文档已经被检索到),把“查询与文档的相关性”评为在受控设置下强4 NeurIPS 2025 的 C-SEO Bench 给出了具体数字:在 GPT-4o-mini 上的零售领域,最好的传统干预(即改善来源在 LLM 上下文里的位置)让目标文档平均前移 2.77 个名次,而它所测十种内容改写方法中最强的一种只有 0.36。论文自己的措辞没有给出任何倍数:把目标文档“放到 LLM 上下文窗口的第一位,带来的引用排名增益远大于任何一种 C-SEO 方法”。5 为什么会这样,有它自己的文献:模型表现“往往在相关信息位于输入上下文的开头或结尾时最高,而当模型必须访问长上下文中间的相关信息时会显著下降”。8 这个位置不是你设定的。你能施加的影响,是成为那个最精确回答了子问题的段落。

信号

是什么决定哪一段胜出?

决定胜负的是“与查询的相关性”,它的分量超过任何一个被测量过的格式特征:由模型判定的相关性与引用影响力的跨平台相关系数为 r = 0.4322,高于同一数据集里的每一个结构性信号。

以下是 602 条受控 prompt、21,143 条检索层引用、18,151 个被抓取页面的描述性关联,2026 年 4 月发表。比较的是引用影响力最高与最低四分位。3

页面特征与引用影响力的关联该怎么读它
模型判定的查询相关性跨平台最强信号,r = 0.4322回答那个具体问题,而不是那个话题
答案与被引内容的嵌入相似度r = 0.3561用答案会使用的词把它说出来
含有数字或统计0.1171 对 0.0725,即 +61.6%只用真实、带日期、有出处的数字
含有定义标记0.1252 对 0.0795,即 +57.3%把“X 是……”写成一句平实的话
标题数量最高四分位 10.59 个,最低四分位 0.85 个存在混淆;好页面本来标题就多
列表密度最高四分位是最低四分位的 8.94 倍同样的混淆;为读者而做
问答式页面格式0.0947 对 0.1005,即 −5.7%略微为负;可能混入了劣质 FAQ 页

作者自己的注意事项规定了这些结论能被推到多远:他们无法分离“标题导致被吸收”与“做得好的页面既会被引用、又恰好标题更多”;问答格式的负向结果也可能与劣质 FAQ 页混淆在一起。3 在同一份数据集里,信号还因引擎而异:Google 最强的是嵌入相似度加定义标记,Perplexity 最强的是相关性加标题数量与长度。对这一整类发现,批判性综述给出的指示才是该随身带走的,它把文档结构只评为中等且不一致:“结构应当逐阶段评估,而不是被当成万能护身符。”4

直接控制

你能控制引擎用哪一段吗?

只能反向控制,而且只在有文档提供控制手段的界面上。Google 的指引点名了四个:“要限制你的页面在搜索中展示的信息量,请使用 nosnippetdata-nosnippetmax-snippetnoindex 控制”,而它的 AI 功能跑在同一套摘要资格上。6 这让你有办法把某一块文字排除在被引用之外,或给页面可展示的量设上限,两者都是在减少你的暴露面,而不是在引导它。

不存在正向的对应物。没有引擎提供“把某一段标记为你希望被引用的那段”的办法,也没有任何标记、文件或指令能提名一个。唯一可用的正向影响是构成性的:让回答子问题的那一段成为整页里最清楚、最精确对准靶心的东西,并给它一个把问题说出来的标题。这不是技巧,而这恰恰是它一直有效的原因。

长度

在这个阶段,更长的页面会赢吗?

长度与引用位置几乎无关,而两个触及这个问题的大型数据集之所以结论不一致,是因为它们测的是不同的结果变量。2025 年 12 月一项覆盖 560,346 条 AI Overviews、1,677,876 个被引 URL 和 174,048 个可提取正文页面的厂商研究,测得词数与引用位置的 Spearman 相关性为 0.04;53.4% 的引用落在 1,000 词以下的页面上。7 2026 年 4 月那份学术数据集测的是平均影响力而不是位置,发现影响力随长度上升,一直延伸到 3,000 词以上。3

不同的结果变量、不同的样本,没有可用的调和方案。站得住脚的立场是:作为杠杆,长度是中性的;值得优化的,是这个页面真正回答了多少个不同的子问题,以及每个答案在自己的段落里坐得多干净。为了凑字数而加字,是这件事里肯定错的那个版本。

本文的诚实边界

没有引擎公开过它如何切分页面,所以“AI 系统把内容切成 200 到 400 个 token 的段落”这个广为流传的说法,是对封闭检索栈内部的断言,不是事实:当心智模型有用,当规格说明一文不值;任何人给你说出你自己页面的切块 token 数,都是在猜。这里的段落统计来自一份描述性的厂商数据集,没有基准率;特征关联来自一篇预印本,作者把验证性分析留给后续工作,并声明无法区分因果与相关。第四阶段是检索之后被仪器化得最好的阶段,而它依然完全是从外部测量的。

产品在哪里派得上用场,在哪里派不上

第四阶段你可以直接读,免费,不需要任何软件:在 Google AI Mode 上跑你的买家问题,点开引用,看每个被引页面上的滚动定位高亮落在哪里。这个习惯教给你的段落选择知识,比任何指南都多,包括这一篇。Bavior 做的是重复的那一半:它按计划把一组固定的 prompt 打到五个引擎上,并记录每条答案引用了哪些来源,让你能在几十次运行而不是一次运行的尺度上,看出一次改写有没有改变什么;当被引用的来源是一条活跃的讨论帖时,它会用你掌控的账号起草回复,在任何内容发出之前由你审批。它不改写你的页面,不给你的段落打分,也无法让重排器偏爱你。免费 AI 可见性检测免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 29 日)。

出处,全部核查于 2026 年 8 月 29 日
  1. 段落抽取数据集,2026 年 7 月发布:15,699,298 条 Google AI Mode 引用,覆盖 270 万个页面;47.7% 为滚动定位高亮,段落中位数 117 词,约 85% 自洽,80% 答案前置,被反复引用的段落中 48% 以问句开头,一次性段落中为 22%。厂商发布,只描述不链接。
  2. 引用落点研究,2026 年 6 月发布:10,000 条 AI Overview 回答、100,000 个通过滚动定位片段匹配的引用落点;38% 的引用来自前 100 词,2025 年对照集中为 20%;作者声明该数据为相关性质。厂商发布,只描述不链接。
  3. Zhang、He、Yao,《From Citation Selection to Citation Absorption》,2026 年 4 月 28 日,arXiv:2604.25707(预印本,开放数据集)。arxiv.org/abs/2604.25707
  4. Martinez,《Optimizing Visibility in Generative Engines: A Critical Survey of GEO (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(综述预印本;表 4 给出各杠杆的证据等级)。arxiv.org/abs/2607.14035
  5. Puerto、Gubri、Green、Oh、Yun,《C-SEO Bench: Does Conversational SEO Work?》,NeurIPS 2025 数据集与基准赛道,arXiv:2506.11097。arxiv.org/abs/2506.11097
  6. Google Search Central,《AI features and your website》(摘要控制;第一方文档,更新于 2025 年 12 月 10 日)。developers.google.com/search/docs/appearance/ai-features
  7. 内容长度研究,2025 年 12 月发布:560,346 条 AI Overviews、1,677,876 个被引 URL、174,048 个可提取正文的页面;词数与引用位置的 Spearman 相关性为 0.04。厂商发布,只描述不链接。
  8. Liu 等,《Lost in the Middle: How Language Models Use Long Contexts》,TACL 2024,arXiv:2307.03172。arxiv.org/abs/2307.03172
  9. Google Search Central,《Optimizing your website for generative AI features on Google Search》(第一方文档,更新于 2026 年 7 月 10 日)。developers.google.com/search/docs/fundamentals/ai-optimization-guide
  10. Sun 等,《Is ChatGPT Good at Search? Investigating LLMs as Re-Ranking Agents》,EMNLP 2023,arXiv:2304.09542。arxiv.org/abs/2304.09542
常见问题

你想知道的,都在这里。

一段文字要多长才容易被 AI 搜索引用?

在 2026 年 7 月一份覆盖 1,570 万条 Google AI Mode 引用的厂商数据集中,被高亮段落的中位长度是 117 词,大致就是一个紧凑的段落,而其中约 85% 不看上下文也能读懂。这是对“什么会被抽走”的描述,不是一个要去凑的目标,而且没有任何引擎公开过自己的切块尺寸。这个发现有用的版本是结构性的、而非数值性的:把每个答案写成在一个段落之内就完整,因为引擎抬走的东西就是这个形状。

我能告诉 AI 引擎该引用哪一段吗?

正向地不能:没有任何引擎提供“指定首选段落”的办法,也没有任何标记、文件或指令能做到。现存的控制手段全是做减法的:Google 的文档把 nosnippet、data-nosnippet、max-snippet 和 noindex 列为“限制你的页面在搜索中展示信息量”的方式,而它的 AI 功能跑在同一套摘要资格上。所以你可以把某个块排除在被引用之外,或给页面可展示的量设上限;而唯一可用的正向影响,是把回答那个问题的段落做成整页里最清楚、最自洽的那一段。

是页面权威度决定哪一段被选中吗?

在这个阶段不是:重排评的是某个段落对那条具体子问题回答得多好,所以一个弱页面里写得清楚的答案,可以赢过一个强页面里被埋起来的答案。权威度起作用是在更早的检索阶段,那里排名决定这个页面能不能成为候选。这个区分有实际后果:如果一个站点更弱的竞争对手总是被引用,问题通常不在他们的域名强度,而在他们那一段的形状;点开那条引用、看看哪些字被高亮了,你一分钟就能确认。

标题层级和列表会让页面更容易被引用吗?

相关性是真的,因果性未被证明。在 2026 年 4 月发表的一份 602 条 prompt 的学术数据集中,引用影响力最高四分位的页面标题数中位为 10.59,最低四分位为 0.85,列表密度是后者的 8.94 倍,但作者直接写明,他们无法分离“标题导致被吸收”与“做得好的页面既会被引用、又恰好标题更多”。2026 年那篇批判性综述把文档结构评为“中等且不一致”,并建议在不预设效应方向的前提下去测试。做它是因为它让页面更好用;别为它承诺任何东西。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

真正在竞争的不是页面。
是那一个段落。

免费试用