理由和專案管理慣例沒有關係,而是來自「你什麼都不動的時候,測量自己會怎麼動」。2026 年那篇批判性綜述把可複現性的證據集中到了一處。Kirsten 等人(其 4,706 條查詢的審計是同儕審查成果)發現,在溫度為零的條件下重複執行一次,會改變 9 到 28% 的判定。2 Schulte 等人在四個引擎上觀察 45 天(一個很小的瑞士查詢集合),記錄到逐日的來源級 Jaccard 落在 0.34 到 0.42 之間。1
把這兩條放在一起讀。在任意一天裡,引擎為你這套 prompt 引用的來源中,有很大一部分和昨天不一樣,而你這邊什麼都沒改。這就是任何干預必須蓋過的量級,也是為什麼基線是一個分布而不是一次讀數。跑一次單條 prompt,告訴你的關於引擎的資訊很少,關於「你執行它的那一分鐘」的資訊倒是不少。
要多少條 prompt、跑多少次才買得到一個可用的區間,算在面板規模裡;某個面板規模能偵測到什麼、偵測不到什麼,算在統計檢定力裡。這裡都不重複;本文只取它們的結論:報告單位是面板,單條 prompt 永遠不是。
這對日曆的後果,值得對訂下這個期限的人說清楚。90 天之內,你可以建立一條你信得過的基線、把修復上線,再把面板重讀一次。你沒辦法同時證明某一次內容改動導致了某一段變化,因為拿一次前後對比去對付一台會漂移的儀器,撐不起這個結論。第一週把這話說了,遠比第十二週再說好。