因为有两个阶段在评两件不同的事,而一次编辑同时动了两者。找到你页面的那个阶段,评的是它与某人输入的问题之间的重合度;写出答案的那个阶段,评的是你的段落能不能被干净地摘走。一次通过替换页面里普通用词来改善后者的编辑,会从前者身上减掉分数,而这发生在你关注的任何指标存在之前。2026 年那篇批判性综述用一句话说清了后果:一次改写“因此可能在被注入之后表现良好,同时让该文档在上游更难被检索、或更缺乏竞争力”。2
那句话底下的测量是 SAGEO Arena,发表于 KDD 2026,它把其他基准漏掉的那一段重建了回来。它从九个公开检索数据集里取了 2,700 条查询,抓取了背后的 171,003 份网页文档,并在生成器之前放上真实的检索器与重排器,而不是一个固定的候选清单。1 它对“只改正文”的判决很平直:“只优化正文,会在所有阶段上一致地损害可见度。”在十种策略上平均,检索阶段的前 20 名命中率从 0.58 降到 0.53,重排后的前 10 名命中率从 1.00 降到 0.84,最终引用率从 0.50 降到 0.47。1
归因才是有用的那部分,因为它点名了哪些编辑带着风险。作者把检索损失归因于“优化后的文档与用户查询之间的词面不匹配,而用户查询通常使用常见词汇”,并给出了它的形状:“把‘吃饭’这类词换成‘饮食作息’,或把‘睡觉’换成‘嗜睡状态’,会直接降低词项重合度。”1 这个次序对预算意味着什么,是可检索性天花板那篇;相关性与位置为什么本来就压过文笔,是相关性与排名那篇。本页只谈这次编辑本身。