まず、探しているものの大きさから始めます。C-SEO Bench は NeurIPS 2025 の Datasets and Benchmarks Track で発表され、6 領域、1.9k 件を超えるクエリにわたって合計 10 種類のコンテンツ手法を走らせました。小売の列では、10 種類のうち最も強いものが対象文書を 0.36 順位分動かし、最も弱いものは −0.07 でした。一方、その文書をモデルのコンテキストの先頭に置くこと、つまりランキングがやっていることの価値は 2.77 でした。1 順位の 3 分の 1 は、単に検出しにくいというだけではありません。月曜にあなたがすることを変えるには小さすぎるのです。
計器のほうも動きます。温度を制御できる環境では、温度ゼロでの繰り返し実行が、4,706 件のクエリ全体で判断の 9–28% を変えます。4 同じ質問を二度すれば、それは同じ実験ではありません。その揺らぎより小さい効果は、構造上どうやっても見えません。
次に母集団の問題です。C-SEO Bench は、その変動が「正にも負にも振れ、部分的に打ち消し合う」と報告しています。小売で最も強い手法は 26.2% のケースで助けになり、12.8% のケースで害になったため、「全体の平均効果はゼロに近いが、分散は大きい」というわけです。1 54 ケースのうち 3 つが Holm-Bonferroni 補正の後でも有意に正でした。つまりその 3 つは、多くの手法を一度に検定したことによる見せかけではありません。1