當一條 prompt 在連續兩個完整週期裡、在每一個引擎上都回傳同一個結果,而且這段連續紀錄背後的執行次數高到足以讓它有意義時,它就失去了區分力。後半句正是團隊會跳過的部分,跳過它就會汰除掉從來沒被量測過的 prompt。在 n 次執行中零次出現,真實比率的 95% 上限大約是 3/n。跑 5 次時這個上限是 45%,10 次是 30%,30 次是 10%,60 次是 5%。一條空手而回十次的 prompt,完全相容於接近三分之一的真實出現率。
所以請把門檻設在上限,而不是設在連續次數上:只有當累積的執行次數把上限壓到一個你真的不在乎的位置時,才因為持續為零而汰除它,實務上這代表每個引擎約 60 次觀測。同一筆算術倒過來也成立,因為連續 60 次出現會把下限推到 95% 附近。把兩三條這樣的飽和 prompt 留在面板裡當預警線,因為一條你從來都贏的 prompt 突然掉下去,代表發生了很大的事。
同一種失效還有一個比較安靜的形態:出現率穩定在中間區間,而答案正文從來不變的 prompt。那是在量測一次固定的檢索,而不是一場活的競爭;它通常回報的是你採集設定的事實,而不是市場的事實。