检索接收扇出产生的每一条查询,并为它返回一个候选文档集:要么来自预先构建的索引,要么来自提问当下的实时抓取。这个机制没什么玄妙的:它就是搜索,带着这个词所有寻常的后果。Google 对自己的 AI 界面就是这么说的:“我们在 Google 搜索上的生成式 AI 功能,根植于我们核心的搜索排序与质量系统”10;而要有资格成为支持链接,页面“必须已被收录,并且有资格带摘要出现在 Google 搜索里,满足搜索的技术要求”。1
两种检索模式并存,而它们的失效方式不同。基于索引的检索意味着那次关键的抓取发生在更早的时候,可能是几周前,由某个爬虫完成,而引擎手上那个版本的你的页面,就是那次爬虫看到的样子。实时检索意味着有个抓取器会在有人提问的当下拉取该 URL,这让时效性变得即时,也让响应慢、机器人挑战或一个 403 变得致命,而这些对索引来说从来都不致命。本课程涵盖的多数系统两种都跑,用的是不同的 user-agent 令牌。上一个阶段决定有多少条独立查询会到达这里;总览见AI 搜索如何工作这一阶段。