理由和项目管理惯例没有关系,全部来自“你什么都不动的时候,测量自己会怎么动”。2026 年那篇批判性综述把可复现性的证据集中到了一处。Kirsten 等人(其 4,706 条查询的审计是同行评议成果)发现,在温度为零的条件下重复跑一次,会改变 9 到 28% 的判定。2 Schulte 等人在四个引擎上观察 45 天(一个很小的瑞士查询集合),记录到逐日的来源级 Jaccard 在 0.34 到 0.42 之间。1
把这两条放在一起读。在任意一天里,引擎为你这套 prompt 引用的来源中,有很大一部分和昨天不一样,而你这边什么都没改。这就是任何干预必须盖过的量级,也是为什么基线是一个分布而不是一次读数。分布需要重复才看得见。跑一次单条 prompt,告诉你的关于引擎的信息很少,关于“你跑它的那一分钟”的信息倒是不少。
要多少条 prompt、跑多少次才买得到一个可用的区间,这是算术,算在要多少 prompt 和多少次运行里;给定面板规模能检测到什么、检测不到什么,算在统计功效里。这里都不重复;本文只取它们的结论:报告单位是面板,永远不是单条 prompt。
这对日历的后果,值得对定下这个期限的人说清楚。90 天之内,你可以建立一条你信得过的基线、把修复上线、再把面板重读一次。你没法同时证明某一次内容改动导致了某一段变化,因为拿一次前后对比去对付一台会漂移的仪器,撑不起这个结论。第一周把这话说了,是一场比第十二周再说好得多的对话。