有两项被转述的测量决定了这套工作流的形状,而且它们指向同一个方向。2026 年那篇生成式引擎优化的批判性综述转述道:Kirsten 等人发现,温度为零时重跑同一组 prompt 会改变 9% 到 28% 的判定;Schulte 等人在四个引擎、45 天、一个很小的瑞士查询集合上测得,来源层面的日间 Jaccard 重合度为 0.34 到 0.42。1 Jaccard 是交集除以并集,所以 0.34 意味着:在相邻两天出现过的所有被引来源里,只有大约三分之一是两天都出现的。
把这两个数字放在一起读,结论是这份每周的引用清单是对一个正在移动的总体的一次抽样,而不是世界的一个状态;上周二到这周二之间变掉的东西,大部分与你无关。一套按周对着数字波动做反应的流程,反应的是它自己的仪器。所以这一周被设计成收集:它累积记录,抓住单次观测能诚实确立的那些事件,把反应留给噪声有地方被平均掉的更长尺度。给定样本量下的置信区间有多宽,是算术,写在要多少 prompt、每条跑多少次和统计功效里。每周跑依然值得,因为频率买到的是反应时间和那些会过期的事件;它只是买不到显著性。