幾乎每一項已發表的 GEO 實驗,都是在最難的那一關已經過關之後才開始的,所以它們的結果描述的是影響力,而不是被發現。一個答案引擎按順序跑三個階段:檢索候選文件、把其中一部分組裝進上下文視窗、再從那段上下文生成文字。一個直接把一組固定文件交給模型的基準,等於已經悄悄替你完成了階段 1 與階段 2。
只要讀到方法章節,那篇開創性論文對自己的實驗裝置是坦白的。2024 年那篇 KDD 論文搭了一個兩步式合成引擎:取某個查詢在 Google 的前五條結果,再讓 gpt-3.5-turbo 以這五個來源為接地寫出答案;所以被優化的頁面按構造就已經在這五篇文件的上下文裡。3 NeurIPS 2025 上發表的 C-SEO Bench 涵蓋 2 項任務、6 個領域、超過 1.9k 條查詢與 16k 篇文件,同樣是先給定候選集,再測量集合內部發生了什麼。2 兩個都是好實驗。但兩者都沒有測試一個被優化的頁面能不能被找到。
2026 年有一篇 KDD 論文把缺失的階段補了回來。SAGEO Arena 在 171,003 篇文件、2,700 條查詢上恢復了檢索與重排,發現只優化文件正文會讓平均前 20 名出現率下降約 9%、重排後前 10 名出現率下降 16%、最終引用率下降約 6%。4 綜述對這個結果的解讀是最值得記住的一句:「一次改寫因此可能在被注入之後表現良好,同時讓文件在上游更難被檢索、更缺乏競爭力。」1 一門主要技術可能在階段 1 損失得比在階段 3 賺到的更多的學科,無法脫離階段 1 獨立實踐。