同一條 prompt 的兩次執行之間,至少有四樣各自獨立的東西在變,而其中只有一樣是語言模型的取樣 temperature。沿著AI 搜尋如何運作這個階段描述的管線走:第一樣是查詢展開。Google 的文件寫明,AI Overviews 與 AI Mode「可能會使用一種『查詢扇出』技術……來生成回答」,也就是跨子話題與資料來源發起多次相關搜尋。3 這些子查詢是生成出來的,不是查表查到的,所以在任何排序發生之前,不同的子查詢集合就已經產生了不同的候選池。
第二樣是檢索本身。每一條生成出來的子查詢打到的,是一個持續重新抓取、跨機器分片、並受新鮮度與個人化邏輯影響的即時索引。第三樣是選擇:候選被合併、去重、重排,並裁剪到上下文預算之內,而卡在截斷線附近的近似並列,每次執行的解法都不一樣。第四樣是生成,模型在這裡決定把選中的來源裡的哪一個掛到哪一句上:一個來源可以被檢索到、被讀取,然後不被引用。
這四樣裡有兩樣位在你能控制的一切之上游,這就是為什麼把 temperature 調到零並不會讓系統變成確定性的。2026 年的批判性綜述把話說得很直白:報告出來的 temperature 為零,「既固定不了索引,也固定不了檢索,更固定不了外部服務的版本。」1