先看看要找的东西有多大。C-SEO Bench 发表于 NeurIPS 2025 数据集与基准赛道,在六个领域上跑了总计十种内容方法,覆盖逾 1.9k 条查询与 16k 份文档。在零售那一列里,十种方法中最强的一种平均把目标文档的排名提升 0.36 位,最弱的是 −0.07 位;而只是把文档放到模型上下文的第一位(这正是排名在做的事),价值是 2.77 位。1 三分之一个排名位的效应不只是难以检出,它小到就算检出了也不会改变你周一要做的事。
仪器本身也在动。在温度可控的那些面上,温度为零时重复运行会改变 9–28% 的决策,这是在美国和德国的 4,706 条查询上测出来的。4 同一个问题问两遍,就不是同一个实验。任何比这个抖动更小的效应,从构造上就是看不见的,改写写得再仔细也没用。
还有总体的问题。C-SEO Bench 写道,它的这些方法产生的位移“既有正的也有负的,并且部分相互抵消”:在零售数据上最强的那个方法,在 26.2% 的案例里有正向提升,在 12.8% 的案例里是负向,于是“总体平均效应接近零,但方差很大”。1 54 个案例里只有三个显著为正,而这个判定是经过 Holm-Bonferroni 校正的,所以这三个不是“测得多了”撞出来的假阳性。1 拥有这些性质的领域产出零结果,就像抛硬币产出正面一样自然。