先看看要找的東西有多大。C-SEO Bench 發表於 NeurIPS 2025 資料集與基準賽道,在六個領域、逾 1.9k 條查詢上跑了總共十種內容方法。在零售那一欄裡,十種之中最強的一種把目標文件移動了 0.36 個排名位,最弱的是 −0.07;而把文件放進模型上下文的第一位,也就是排名在做的事,價值是 2.77。1 三分之一個排名位不只是難以偵測,它小到不足以改變你週一要做的事。
儀器本身也在動。在溫度可控的介面上,溫度為零時的重複執行,在 4,706 條查詢上改變了 9–28% 的決策。4 同一個問題問兩次,就不是同一個實驗;任何比這個抖動更小的效應,從構造上就是看不見的。
還有母體的問題。C-SEO Bench 報告說,這些位移「既有正的也有負的,並且部分相互抵消」:它在零售上最強的方法在 26.2% 的案例裡有幫助,在 12.8% 的案例裡有害,所以「整體平均效應接近零,但變異很大」。1 54 個案例裡有三個在 Holm-Bonferroni 校正之後仍顯著為正,所以這三個不是一次測試很多方法撞出來的假象。1