C-SEO Bench は、生成エンジンに気に入られるように文書を書き換えることが実際に効くのかを測るベンチマークで、その答えはおおむねノーです。NeurIPS 2025 の Datasets and Benchmarks Track で発表され、質問応答と商品推薦の二つのタスクを六つの領域にわたって扱い、コードとデータは公開されています。1 これはGEOとSEOのステージが組み立てられる土台にもなっている結果です。
アブストラクトは結果をぼかさずに述べています。「現在のC-SEO手法の多くは、大部分が効果がないだけでなく、文書ランキングに負の影響を与えることも多く、これは期待されるものとは逆である。むしろ、LLMコンテキスト内での情報源の順位を上げようとする従来のSEO戦略のほうが、有意に効果的である。」論文自身のまとめは、対象文書をコンテキストウィンドウの先頭に置くことが「LLMの回答において、どのC-SEO手法よりもはるかに大きな引用ランキングの向上をもたらす」というものです。
この結果を、ふつうの単発の実験より退けにくくしている細部が二つあります。一つ目は広さです。論文は54件の「手法と領域」のケースを報告していて、散発的な勝ちがあれば表に出るだけの数があります。そのうえでの発見が「54ケースのうち、ランキングの改善が統計的に有意だったものは3つしか見つからなかった」であり、質問応答タスクではどの手法も効きませんでした。二つ目は失敗の向きです。いくつかの変換は役に立たなかっただけでなく、文書の順位を下げました。統計の追加は、測定された24の設定のうち19でランキングを下げています。1 中立の施策は安く済みますが、負の施策は、間違ったブログ記事を読んだ代金として払う税金です。