首页/学习 GEO/第 5 阶段
AI 搜索如何工作 · 第 5 阶段

合成与归因,也就是 AI 搜索的最后一个阶段,到底发生了什么?

这是唯一一个措辞能改变结果的阶段,所以几乎所有 GEO 建议都瞄准这里;也正因如此,几乎所有这类建议都是在一个跳过了前四个阶段的设定里被测量出来的。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

合成与归因,是模型基于第四阶段选出的段落写出答案、再把来源链接挂到部分论断上的那个阶段。「挂上链接」和「拿链接背后的页面核对过这句话」不是一回事:2023 年一项对生成式搜索引擎的评测发现,平均而言,只有区区 51.5% 的生成句子被其引用完全支撑。5

关键要点
  • 引用是挂在某个论断上的链接,提及是你的品牌名出现在答案正文里。这两者经常分开,所以要记两列,而不是一个笼统的可见性分数。
  • 被引用不等于被描述对了。2026 年一项对 Google AI Overviews 的审计发现,98,020 条原子论断中有 11.0% 得不到旁边所引页面的支撑,其中占比更大的失败方式是「遗漏」。8
  • 措辞作用在这里,也只作用在这里,作用对象是已经熬过检索、排序和选择的材料。这个阶段的每一次干净测量,都是先把页面塞进模型上下文的,所以它们都描述不了开放网络。
  • 把你希望被引用的每一句都写成「没有邻居也依然成立」:主语、限定条件、数字和日期都写进句子内部。
  • 在所有已发表的指标上,一个伪造的统计数字和一个真实的得分一样,因为管线里没有任何一环会去核查。这是「成为那个经得起核查的来源」的理由。
定义

合成与归因阶段发生了什么?

模型收到被选中的段落短名单,基于它们写出答案,然后把链接从论断挂回来源。这是两个可以分开的操作,而「可以分开」这件事很重要,因为要给一句话挂上链接,这句话并不必须是对来源的忠实概括。这些系统里的归因,是生成句子与某份在上下文中的文档之间的事后关联,不是对「该句由该文档推出」的核验。

这就是下面那个准确性问题的全部根源。它也解释了让品牌团队栽跟头的那种怪异不对称:引擎可以在正文里点名竞争对手、却链接到你的页面;也可以链接你的页面、却谁的名字都不提,因为这两个输出由不同机制产生,没有任何要求说它们必须一致。决定什么能抵达这一阶段的前四个阶段,见AI 搜索如何工作这一阶段

两种结果

提及和引用有什么区别?

引用是引擎挂在某个论断上的链接;提及是你的品牌名出现在答案的行文里。这两者经常分开,而只有其中一个在被朗读出来时还幸存。2026 年 6 月一项覆盖 115 条 prompt、3,981 次域名出现、四个平台、14 个国家的厂商研究发现,约 62% 的来源出现是「答案从未点名品牌」的链接,并报告了两个画像几乎相反的引擎:一个在约 84% 的出现中点名品牌、却只在约 21% 中给链接,另一个在约 21% 中点名、却在约 87% 中给链接。6 样本很小;发现的是方向,不是小数位。

实际后果是,「AI 可见性」需要两列,而不是一列。有链接没提及,带来的是转介流量,对一个从不点击的读者则什么都不带来。有提及没链接,带来的是记忆,没有流量。你需要哪一个,取决于你是想被发现还是想被记住;一份把两者压成单一分数的报表,恰好丢掉了决定下一步该做什么的那个区分。

保真度

被引用是否意味着被准确描述?

不是,而且实测的错误率高到足以改变你的写法。哥伦比亚大学 Tow 数字新闻中心在 2024 年 11 月用 20 家出版机构的 200 条引文测试 ChatGPT Search,发现 200 条回答中有 153 条部分或完全错误,而模型只有 7 次表达了不确定。3 2025 年 3 月的后续研究在八个引擎上跑了 1,600 条查询,构成是 20 家出版机构乘 10 篇文章乘 8 个助手,结果超过 60% 的查询被答错;最差的那个助手 94% 的情况下是错的,在它测试的 200 条提示词中产生了 154 条指向错误页面的引用。授权协议并未带来准确性上的好处,而屏蔽了爬虫的出版机构依然被引用。4

独立研究从别的角度指向同一处。2023 年一项对生成式搜索引擎的评测发现,平均而言只有区区 51.5% 的生成句子被其引用完全支撑,而只有 74.5% 的引用能支撑它所对应的那句话。5 2026 年一项审计把 7,491 条 Google AI Overviews 拆成 98,020 条原子论断,逐条与旁边所引的页面核对:11.0% 得不到支撑,其中 4.1% 与所引内容直接矛盾或冲突,另有 7.0% 在所引来源正文里根本没被提到。8 更大的失败方式是「遗漏」而不是「矛盾」:常见情形不是引擎在跟你的页面唱反调,而是引擎把某句你从没说过的话记到你的页面名下。另一项 2026 年研究测得可信来源占比为 71.4% 到 86.3%,随助手和话题而异。8 不同方法、不同分母,同一个结论:一句话上挂着链接,几乎不能告诉你这句话对那个来源来说是不是真的。

所以为「被引用」而优化,和为「被正确表述」而优化不是一回事,而后者才是保护你的那个。一个只有在邻居在场时才成立的句子,会在邻居不在的情况下被摘走。

证据

为什么措辞只作用在这个阶段?

措辞只在「合成」这一步起作用,因为在此之前的每个阶段都已经决定了哪些段落能进到这个房间里;改写能改变一个段落赢得多少答案篇幅,却改变不了它当初有没有被检索到。

下表给出的是 KDD 2024 的结果,用的是该论文自己的指标。基线「不做优化」在「位置加权词数」上得 19.3,即答案中被记到你名下的词的份额,若你被引用得晚则打折。1

改写技巧在专门搭建的引擎中的 PAWC它能证明什么
不做优化19.3基线
关键词堆砌17.7比什么都不做还差
添加出处24.6仅下游效应
添加统计25.2仅下游效应
添加引语27.2九种里最好,仅下游效应

这张表里每一个数字,都是在「被优化的页面已经在引擎上下文里」的前提下产生的。实验抓取某条查询的 Google 前五条结果,让 GPT-3.5 基于这五份文档写出答案,而被测页面就在其中。1 正是这个设计让它成为对第五阶段的干净测量,也正是这个设计让它对第二到第四阶段闭口不言。2026 年那篇批判性综述把它支撑的那条因果主张评为置信度,同时注明该证据「未涉及自然检索」;并单独否定了对该论文头条数字的流行推广,称其只是「在某个特定配置下、某一个指标上的相对最大值」。2

代价出现在「相乘」这一步。2026 年一项把检索与重排重新纳入、覆盖 171,003 份文档与 2,700 条查询的 KDD 基准测得:只改正文的优化把平均前 20 位出现率降低约 9%,重排后前 10 位出现率降低 16%,最终引用率降低约 6%。7 用第三阶段的损失买来的第五阶段收益,是净亏。措辞是最后才该拉的那根杆,也是要拉得最轻的那根。

阴暗的双生子

这个阶段会诱发什么样的失败?

伪造归因,也就是添加看起来像引用、背后却没有真实来源的文字,正是第五阶段制造出的那个特定诱惑,而这个领域的开山论文无意中演示了它。它为「添加出处」这一技巧给出的示例输出,把结论归给了一家看起来并不存在的机构所做的调查,而论文给这个示例记下的是 132.4% 的相对提升。1 那里被操作化的技巧是「添加引用体文字」,不是「添加真实引用」,而指标分辨不出区别,因为管线里没有任何一环会去核查。

2026 年那篇综述用一句话点破了问题:「添加一个伪造的统计数字可能提高被复用的概率,同时降低认知质量。因此标准不是『加数字』,而是提供相关、可核查、带日期、且出处得当的证据。」2 它还把边界画成了一个你不用请律师就能套用的形式。它的检验是:商业意图有没有披露,以及对竞争对手的呈现有没有伪造的贬损;照这个读法,重排你的段落或补上一份经核实的一手来源通常能过关,而一段栽赃式的证言、或一句为了让模型偏向你而写下的指令则过不了。2

真正该替你做决定的是那个不对称。一个带具名、带日期、可点击来源的真实数字,赢得的摘取收益和一个编造的一样多,却不带任何责任风险;而在一个「八个引擎、1,600 条查询的测试里已经有超过 60% 的查询被答错」的领域里,成为那个经得起核查的来源,是一个可持续的位置,而不是一个技巧。4

应用

那你到底该怎么写?

把你希望被引用的每一句话,都写成「没有上下文也依然成立」。把主语、限定条件和日期直接写进句子内部:不要写「这个去年涨了 30%」,而要写「在一项发表于 Findings of ACL 2026、覆盖 4,706 条查询的研究中,Google AI Overview 所参考的域名平均有 53% 不出现在自然结果前十里」。9 第二个版本经得起被抬走;第一个版本会变成一个你没说过、却被挂在你名下、而且你无法编辑的主张。

2026 年那篇综述自己对「什么是可以合理推荐的」的总结,比大多数 GEO 清单都短:「做出一个相关、完整、可核查、结构清楚、技术上可被检索的页面;然后分别测量检索、引用与保真度。」2「分别」是关键词,因为一个揉在一起的可见性总分,说不出三者中是哪一个动了。同一篇综述还要求:审计要把引用率与一张覆盖口吻、归因准确性和事实支撑的矩阵配对使用,这正是这个阶段所奖励的那个三列习惯。

然后让第五阶段的工作保持在应有的比例上。它的证据基础是整条管线里最窄的,它的效应只在下游被测量过;综述把权威口吻评为弱且不稳定,而把「可摘取的证据」,也就是真实数字、定义和对比,评为中到强,前提是它为真、有出处、且与意图匹配。2 这就是这个阶段全部站得住脚的建议。其余以「为 AI 写作」为名兜售的东西,要么是它的换句话说,要么没有证据支撑。

本文的诚实边界

本文里每一个被测量过的第五阶段结果,都来自「文档已经在模型上下文里」的设定,因为那是目前唯一被找到的、能把这个阶段隔离出来的办法。这些数字没有一个能告诉你开放网络上的一个页面会发生什么;而那个唯一把前面阶段重新纳入的基准测试,测出的合成结果是负的。指标本身也不是你真正在乎的结果:它计的是答案词数的份额,而 2026 年那篇批判性综述把「引用分数能预测点击、转化或收入」这一主张的置信度评为极低。「提及对引用」的拆分依赖一个 115 条 prompt 的厂商样本,足以说明落差存在,不足以给它定量。

产品在哪里派得上用场,在哪里派不上

体检这个阶段不需要任何软件,只需要耐心:在每个引擎上问你的买家问题,然后对每一条答案分别记录三件事,即你的页面有没有被链接、你的品牌有没有在正文里被点名、以及答案关于你说的话是不是真的。第三列是没人会记的那一列,也正是那一列能在客户之前先抓住一次错误描述。Bavior 自动化的是采集,不是判断:按计划把一组固定的 prompt 打到五个引擎上,逐次记录被引用的来源;当被引用的来源是一条活跃的讨论帖时,它会用你掌控的账号起草回复,在任何内容发出之前由你审批、修改或否决。它不替你写页面,不核验答案关于你说了什么,也无法纠正一个把你描述错了的引擎。免费 AI 可见性检测免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 29 日)。

出处:全部核查于 2026 年 8 月 30 日
  1. Aggarwal、Murahari、Rajpurohit、Kalyan、Narasimhan、Deshpande,《GEO: Generative Engine Optimization》,KDD 2024,arXiv:2311.09735:arxiv.org/abs/2311.09735
  2. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(综述预印本):arxiv.org/abs/2607.14035
  3. 哥伦比亚大学 Tow 数字新闻中心,《How ChatGPT Search (Mis)represents Publisher Content》,2024 年 11 月:cjr.org
  4. Jaźwińska 与 Chandrasekar,Tow 中心,《AI Search Has a Citation Problem》,2025 年 3 月 6 日;八个引擎、1,600 条查询:cjr.org
  5. Liu、Zhang、Liang,《Evaluating Verifiability in Generative Search Engines》,2023;生成句子中仅 51.5% 被其引用完全支撑,引用中仅 74.5% 能支撑其对应句:arxiv.org/abs/2304.09848
  6. 幽灵引用研究,2026 年 6 月:115 条 prompt、3,981 次域名出现、4 个平台、14 个国家;约 62% 的引用是正文从未点名品牌的链接。厂商发布;按本课程的出处规则,只描述、不链接。
  7. Kim 等,《SAGEO Arena: A Realistic Environment for Evaluating Search-Augmented Generative Engine Optimization》,KDD 2026(arXiv:2602.12187v2,2026 年 8 月 7 日);2,700 条查询、171,003 份文档:arxiv.org/abs/2602.12187
  8. Xu、Iqbal、Montgomery,《Measuring Google AI Overviews》,2026(预印本);98,020 条原子论断中 11.0% 得不到所引页面支撑:arxiv.org/abs/2605.14021。71.4–86.3% 的可信来源占比来自 Vykopal 等,2026,见出处 2 的综述转述。
  9. Kirsten、Große Perdekamp、Wu、Upadhyay、Gummadi、Zafar,《Characterizing Web Search in The Age of Generative AI》,Findings of ACL 2026,第 10827–10848 页;4,706 条查询,AI Overview 所参考域名中 53% 不在自然结果前十:aclanthology.org/2026.findings-acl.526
常见问题

你想知道的,都在这里。

为什么 AI 答案链接了我的站点,却从不说出我的品牌名?

因为答案正文和挂上去的链接是由不同的操作产生的,两者并没有必须一致的要求。2026 年 6 月一项覆盖 115 条 prompt、3,981 次域名出现、四个平台的厂商研究发现,约 62% 的来源出现是“正文从未点名品牌、只挂了链接”,而各引擎差异极大:有一个在约 84% 的出现中点名品牌、却只在约 21% 中给链接,另一个几乎相反。请把链接和被点名的提及分成两列来跟踪,因为它们交付的东西不同:一个带来流量,一个带来记忆。

如果 AI 引擎引用了我的页面,是不是意味着它把我描述对了?

不是:“挂上链接”不等于“核实过”,而实测的错误率很高。哥伦比亚大学 Tow 中心在 2024 年 11 月发现,200 条 ChatGPT Search 回答中有 153 条部分或完全错误;在 2025 年 3 月覆盖八个引擎、1,600 条查询的后续研究中,超过 60% 返回了错误答案,其中一个助手 94% 的情况下是错的。2023 年一项评测发现,生成式搜索答案中只有 51.5% 的句子被其所挂的引用完全支撑。防御办法是:把每一句都写成“被无上下文引用时依然成立”。

在页面里加统计数据和引语,会增加 AI 引用吗?

在唯一一个被干净地测量过的设定里,会,但那个设定完全跳过了检索。KDD 2024 那篇论文在它的“位置加权词数”指标上给出:加引语 27.2、加统计 25.2,对照基线 19.3,而被优化的页面在实验中已经在引擎的五份文档上下文里了。2026 年一项把检索与重排重新纳入的基准测试发现,只改正文的优化把前 20 位出现率压低约 9%、最终引用率降低约 6%。真实、带日期、有出处的数字值得加;而稀释了页面主题相关性的改写不值得。

为 AI 搜索写作时,值得用权威口吻吗?

2026 年那篇批判性综述把“权威口吻”评为弱且不稳定的支撑,并提醒它可能与可信度相冲突,这让它成为这个领域评分最低的杠杆之一。同一篇综述评为中到强的是“可摘取的证据”:真实的数字、明确的定义和清楚的对比,前提是它为真、有出处、并且与查询意图匹配。落到实处就是:一句带具名来源和日期的平实陈述,胜过一句既没来源也没日期的自信陈述;而且前者经得起后者经不起的准确性核查。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

被引用不等于被描述对了。
两样都要核。

免费试用