同一条 prompt 的两次运行之间,至少有四样东西在变,而语言模型的采样 temperature 只是其中一样。沿着AI 搜索如何工作这一阶段描述的管线走:第一样是查询展开。Google 的文档写明,AI Overviews 和 AI Mode“可能会使用一种‘查询扇出’技术……来生成回答”,即跨子话题和数据源发起多次相关搜索。3 这些子查询是生成出来的,不是查表得到的,所以在任何排序发生之前,不同的子查询集合就已经产生了不同的候选池。
第二样是检索本身。每条生成的子查询打到的是一个持续重新抓取、跨机器分片、还受新鲜度和个性化逻辑影响的实时索引。第三样是选择:候选被合并、去重、重排并裁剪到上下文预算之内,而卡在截断线附近的近似并列,每次运行的解法都不同。第四样是生成:模型决定把选中的来源里的哪一个挂到哪一句话上,一个来源可以被检索到、被读取,然后不被引用。
这四样里有两样位于你能控制的一切之上游,这就是为什么把 temperature 调到零并不能让系统变成确定性的。2026 年的批判性综述把话说得很直白:即便报告了 temperature 为零,它“既固定不了索引,也固定不了检索,更固定不了外部服务的版本”。1