几乎每一项已发表的 GEO 实验,都是在最难的那一关已经过掉之后才开始的,所以它们的结论描述的是“影响力”,而不是“被发现”。一个答案引擎按顺序跑三个阶段:检索候选文档、把其中一部分组装进上下文窗口、再从这段上下文里生成文字。一个直接给模型一组固定文档的基准,等于已经悄悄替你完成了第一和第二阶段。
只要读方法部分,那篇开创性论文对自己的实验装置是坦白的。2024 年 KDD 那篇论文搭了一个两步式合成引擎:取某个查询的 Google 前五条结果,再让 gpt-3.5-turbo 基于这五个来源写出答案;所以被优化的页面按构造就已经在这五篇文档的上下文里。3 NeurIPS 2025 上的 C-SEO Bench 覆盖 2 项任务、6 个领域、超过 1.9k 条查询和 16k 篇文档,同样是先给定候选集,再测量集合内部发生了什么。2 两个都是好实验。但它们都没有测试"被优化的页面能否被找到"。
2026 年有一篇 KDD 论文把缺失的阶段补了回来。SAGEO Arena 在 171,003 篇文档、2,700 条查询上恢复了检索与重排,发现只优化文档正文会让平均前 20 位出现率下降约 9%、重排后前 10 位出现率下降 16%、最终引用率下降约 6%。4 综述对这个结果的解读值得记住:“一次改写因此可能在被注入之后表现良好,同时让文档在上游更难被检索、更缺乏竞争力。”1 一门"主要技术可能在第一阶段损失得比在第三阶段赚到的更多"的学问,无法脱离第一阶段独立开展。