公表されたGEO実験のほぼすべては、難しい部分がすでに片づいた後から始まります。ですからその結果が述べているのは、発見ではなく影響力です。回答エンジンは3つのステージを順に走らせます。候補をリトリーバルし、その一部をコンテキストウィンドウに組み立て、そのコンテキストから文章を生成します。固定の文書集合をモデルに渡すベンチマークは、ステージ1とステージ2を黙って済ませてしまっているのです。
方法のセクションまで読めば、創始論文は自分の実験装置について率直です。2024年のKDD論文は2段階の合成エンジンを組みました。あるクエリについてGoogleの上位5件を取得し、その5つの情報源にグラウンディングした回答をgpt-3.5-turboに書かせるというもので、最適化されたページは構造上すでに5文書のコンテキストの中にありました。3 NeurIPS 2025で発表されたC-SEO Benchも、2つのタスク、6つのドメイン、1.9k件超のクエリと16k件の文書にわたって、同じく候補集合を与えたうえで、その内部で何が起きるかを測っています。2 どちらも良い実験です。しかし、最適化されたページが見つかるかどうかを試したものはありません。
2026年のあるKDD論文が、欠けていたステージを戻しました。SAGEO Arenaは171,003件の文書と2,700件のクエリでリトリーバルと再ランキングを復活させ、文書の本文だけを最適化すると、上位20件への平均出現が約9%、再ランキング後の上位10件への出現が16%、最終的な引用が約6%減ることを見いだしました。4 この結果についてのサーベイの読みこそ、覚えておくべき一文です。「書き換えは、注入されてしまえば良い成績を出す一方で、その文書を上流ではリトリーバルされにくく、あるいは競争力の低いものにしうる。」1 主要な手法がステージ3で得るよりステージ1で失うほうが大きくなりうる専門分野は、ステージ1から独立して実践することはできません。