当一条 prompt 在连续两个完整周期里、在所有引擎上都返回同一个结果,并且这段连续记录背后的运行次数高到足以让它有意义时,它就失去了区分力。后半句正是团队会跳过的部分,而跳过它会让你淘汰掉从来没被测量过的 prompt。在 n 次运行中零次出现的情况下,真实比率的 95% 上界约为 3/n。跑 5 次时这个上界是 45%,10 次时是 30%,30 次时是 10%,60 次时是 5%。一条空手而归十次的 prompt,完全可能真实出现率接近三分之一。
所以请把门槛设在上界而不是连续次数上:只有当两个周期累计的运行次数把上界压到一个你确实不在乎的位置时,才因为“持续为零”而淘汰它,实践中这意味着每个引擎约 60 次观测。反过来的情形是同一笔算术倒过来用:连续 60 次出现把下界推到 95% 附近。不过还是把两三条这样的“饱和 prompt”留在面板里当作警戒线,因为一条你从来都赢的 prompt 突然掉下去,说明发生了很大的事。
同一种失效还有一个更安静的形态:出现率稳定在中间区间、而答案正文从不变化的 prompt。那是在测量固定检索,而不是在测量活跃竞争;它通常报告的是你自己的采集配置,而不是市场。