引用这个结果的人几乎都不知道这个指标是什么。位置加权词数,指的是生成答案的全部字数中被归给你这个来源的比例,并按你的引用出现在答案中的位置做指数衰减折扣。它衡量的是“答案里有多少文字是你的”,不是“有没有人点击”。1 支撑这些数字的基准规模不小:来自九个公开来源、覆盖 25 个领域的 10,000 条查询,这让下一节讲的设计问题成为一个缺陷,而不是规模上的局限。
GEO 技巧到底有没有用?
有三项基准测试检验过这个问题,每一项都补回了上一项跳过的一个环节。按顺序读下来,它们讲的是同一个故事,而不是技巧清单讲的那个。
本页内容
那项开创性的 GEO 基准到底测了什么?
它测的是:一份本来就在模型上下文里的文档,能拿到生成答案中多少比例的文字归属,而不是这份文档有没有被检索到,也不是点击、排名或流量。
| 被测方法 | 位置加权词数 | 对照 19.3 基线 |
|---|---|---|
| 不做优化(基线) | 19.3 | 不适用 |
| 关键词堆砌 | 17.7 | 比什么都不做还差 |
| 使用独特词汇 | 20.5 | 勉强 |
| 权威语气 | 21.3 | 小幅 |
| 易懂化 | 22.0 | 小幅 |
| 加入专业术语 | 22.7 | 小幅 |
| 标注出处 | 24.6 | 第四好 |
| 流畅度优化 | 24.7 | 第三好 |
| 加入统计数据 | 25.2 | 第二好 |
| 加入引文 | 27.2 | 九种里最好 |
为什么那个头条百分比并不是它被使用的那个意思?
那个头条数字,是一个自定义指标在一套人造装置里从 19.3 到 27.2 的相对距离,而这个领域自己 2026 年的综述否定了它:它把“GEO 能提升 40% 可见性”列入“作为泛化说法被否定”的主张,理由是这个数字是“特定配置下、单一指标上的一个相对最大值”。4 有三条注意事项与这个数字同行,却几乎从不被一并引用。
第一条是引擎。主实验并没有去查询 ChatGPT、Google 或 Bing:作者搭了一个合成引擎,先抓 Google 前五条结果,再让一个 2023 年代的模型基于这五个来源作答。1 第二条随之而来:被优化的页面本来就是那五份文档之一,所以检索环节根本不在测试范围内。综述对这个发现的评级正是如此:“一份已经被放进上下文的文档,能因果性地改变自己的排序、被引用或被使用”被评为高置信度,同时在同一行注明该证据“未涉及自然检索”。4 第三条就在同一张结果表里:关键词堆砌落在“什么都不做”的基线之下,是整组方法里唯一如此的一个;此后它在多项基准中被评为零效应或负效应。4
论文里另有两个细节能让这幅图更清楚。它的实机验证按作者自己的脚注只跑了 200 个样本,在那里最好的改写相对基线提升 21%,而关键词堆砌下降 9%。1 另外,该论文为“标注出处”这个方法给出的示例输出,把一个说法归到了一个看起来并不存在的研究机构头上,这意味着这个技巧在实现层面是“加上看起来像引用的文字”,而不是“加上真实的引用”。综述的警告值得记住:加入一个编造的统计数字可能提高被复用的概率,同时损害知识质量。4 引擎本身已经在大规模地错误归因:Tow 中心对八个引擎、1,600 条查询的审计发现超过 60% 返回了错误答案,所以一个“看起来像引用”的编造,是会不断累积的负债。6
当这些技巧真的起作用时,是谁在获益?
收益几乎全部流向起点低的来源:最强的三种方法让排名第五的来源可见度大约翻倍,同时让排名第一的来源份额下降 20–30%。
下表是按来源原始 Google 排名分列的可见度相对变化,取自同一篇论文的第二张表。
| 方法 | 第 1 名 | 第 2 名 | 第 3 名 | 第 4 名 | 第 5 名 |
|---|---|---|---|---|---|
| 权威语气 | −6.0% | +4.1% | −0.6% | +12.6% | +6.1% |
| 流畅度优化 | −2.0% | +5.2% | +3.6% | −4.4% | +2.2% |
| 标注出处 | −30.3% | +2.5% | +20.4% | +15.5% | +115.1% |
| 加入引文 | −22.9% | −7.0% | +3.5% | +25.1% | +99.7% |
| 加入统计数据 | −20.6% | −3.9% | +8.1% | +10.0% | +97.9% |
把检索与重排补回来之后发生了什么?
两项把开创性论文跳过的环节补回来的基准,都发现效果缩小或反转。发表于 NeurIPS 2025 数据集与基准赛道的 C-SEO Bench,在逾 1.9k 条查询上跨六个领域测试了十种对话式 SEO 方法,报告称大多数此类方法“不仅在很大程度上无效,而且经常对文档排名产生负面影响”:54 个受测案例中只有 3 个显著为正,问答类中一个都没有;而在零售领域,把一个来源挪到上下文第一位,平均带来 2.77 位的排名提升,最好的改写方法只有 0.36 位。2 关于相关性与排名的姊妹篇对这项基准有详细展开。
真正把这条证据链收口的是 SAGEO Arena,因为它恢复了检索与重排,而不是提供一个固定上下文。在 171,003 篇文档、2,700 条查询上,它发现只改正文的优化让平均前 20 位出现率下降约 9%,重排后前 10 位出现率下降 16%,最终引用率下降约 6%。3 综述的解读是值得记住的那句话:一次改写可能在被塞进上下文之后表现良好,同时让这份文档在上游变得更难被检索、更缺乏竞争力。4
把三项结果并排放在一起,矛盾就消解了。开创性论文孤立地测量了管线的最后一个阶段,发现改写在那里有帮助;后来的工作测量了各阶段的复合结果,发现同样的改写在上游损失的比在下游获得的更多。这就是为什么实用规则是一条约束而不是一个技巧:绝不要以稀释页面与目标问题之间主题相关性的方式去优化正文。
哪些技巧在三项研究里都活下来了?
有两个带着真实支撑活了下来,即真正的相关性和真实的可抽取证据,而固定配方、权威语气和关键词堆砌都没有。
下表的评级出自 2026 年那篇批判性综述本身,不是我们给的。
| 杠杆 | 综述的评级 | 基准测试补充了什么 |
|---|---|---|
| 查询与文档的相关性 | 强(受控环境下) | 唯一一个胜过所有受测改写方法的杠杆 |
| 在上下文中的位置 | 强(前提是已被检索) | 零售领域 2.77 位,最佳改写方法 0.36 位 |
| 可抽取的证据:数字、定义、对比 | 中到强 | 必须真实、有日期、有归因、且与意图匹配 |
| 时效、价格、明确日期 | 中等 | 一项 252,000 次试验的因子实验测到价格与近期日期有效应 |
| 文档结构 | 中等且不一致 | 去测试,不要预设效应方向 |
| 流畅度与简化 | 弱到中等 | 24.7 对 19.3 基线,仅在合成装置里 |
| 权威语气 | 弱且不稳定 | 21.3,且可能与可信度相冲突 |
| 固定的格式配方 | 泛化性很差 | 54 个受测案例中只有 3 个显著为正 |
| 关键词堆砌 | 零效应或负效应 | 17.7 对 19.3 基线;这个领域被复现最多的负面结论 |
那张表里有一行值得读两遍。“可抽取的证据”是唯一被 2026 年综述评为中到强的内容杠杆,而它的条件是硬约束而不是修饰:判断标准不是“加数字”,而是提供相关、可核实、有日期、且正确归因的证据。4 目前公开发表的唯一一份 AI 引用分类研究在描述层面指向同一方向:含有数字的页面平均影响力高出 61.6%,含有定义标记的高出 57.3%,同时作者明确提醒它无法区分因果与相关。7
有一个流行技巧没有出现在那张表里,因为证据指向相反的方向。“加 schema 标记能提高 AI 引用”被目前唯一一项配对对照测试所推翻:一项厂商研究把 1,885 个新增 JSON-LD 的页面与 4,000 个对照页面配对,在前后各 30 天的窗口内测量,发现 AI Overviews 的引用下降 4.6% 且统计显著,另外两个受测平台没有显著变化。11 Google 自己的文档也认同:出现在它的 AI 功能里不需要任何特殊的结构化数据。5 出于富媒体结果和机器可读性的理由上 schema,不要为它宣称更多。
你要怎样在自己的站点上检验其中一个技巧?
不是靠一次前后对比的截图。三条发现支配着你的检验:答案会漂移,界面互相不一致,收益会随同行采用同一方法而衰减。
先固定“问什么”。一次编辑的效果必须放在引擎自身的方差之下来读,而 2026 年一篇统计学论文发现,许多表面上的差异落在测量本身的噪声基底之内,10 这足以让“改前问一次、改后问一次”变得毫无信息量。请固定一组 prompt,按计划重复地问,并记录每条答案引用了哪些来源,这样你比较的就是一个分布,而不是一张截图。
再固定“在哪里问”。SIGIR 2026 上一项 11,500 条查询的研究测得,同一家公司的三个答案界面之间 URL 层面的 Jaccard 相似度只有 0.11–0.18,9 这正是综述据以指出“可见性是按引擎和界面索引的”的依据。4 在一个界面上的结果不等于在其他界面上的结果;一个在某处奏效的技巧,是在一个引擎、一个领域、一个月份里奏效的。
最后,要预期答案会衰减。C-SEO Bench 发现,同一候选集中采用同一方法的文档越多,收益越小,2 所以本季度测出正效应的东西,是在“同行还没跟进”的条件下测出来的。全程有两件事值得保持不变:一次只改一个变量;以及守住页面的主题相关性。
没有人在一个真实的商业引擎上做过端到端的受控实验。上面每一个结果都来自研究者自己搭的装置:开创性基准的引擎是合成的,且建立在一个 2023 年代的模型上;后来两项基准也都自带检索,而不是去查询一个生产系统。所以“排名压倒改写”是一个来自多方收敛证据的强推断,而不是任何人在真实环境中测出来的系数;给这一切打分的那篇综述本身是预印本,不过三项基准都已通过同行评议。请把否定性结论看得比肯定性结论更结实:被复现的是前者。
本页所有可执行的东西都是免费的,一个下午的编辑就能做完:让页面真正成为它所瞄准问题的最佳答案;在正文里放上真实、有日期、有归因的数字和平实的定义;别去动那些已经排第一的页面;把你找到的任何关键词堆砌段落删掉。这些都不涉及任何软件。软件真正改变的只有上面说的那件测量工作:Bavior 按计划把一组固定的 prompt 打到五个引擎上,并记录每条答案引用了哪些来源。它不提升你的排名,不改写你的页面,也无法承诺本页任何技巧会在你的域名上奏效。免费 AI 可见性检测和免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 30 日)。
- Aggarwal 等,《GEO: Generative Engine Optimization》,KDD ’24(第 30 届 ACM SIGKDD,2024 年 8 月);GEO-bench,10,000 条查询,25 个领域。arxiv.org/abs/2311.09735
- Puerto 等,《C-SEO Bench: Does Conversational SEO Work?》,NeurIPS 2025 数据集与基准赛道;十种方法,逾 1.9k 条查询与 16k 篇文档,54 个受测案例。arxiv.org/abs/2506.11097
- Kim 等,《SAGEO Arena: A Realistic Environment for Evaluating Search-Augmented Generative Engine Optimization》,KDD 2026(arXiv:2602.12187v2,2026 年 8 月 7 日);171,003 篇文档,2,700 条查询。arxiv.org/abs/2602.12187
- 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035;含置信度表与杠杆支撑度表。arxiv.org/abs/2607.14035
- Google Search Central,《AI features and your website》(无需特殊结构化数据;第一方文档)。developers.google.com/search/docs/appearance/ai-features
- Jaźwińska 与 Chandrasekar,《AI Search Has a Citation Problem》,哥伦比亚大学 Tow 数字新闻中心,2025 年 3 月 6 日;八个引擎、1,600 条查询。cjr.org
- Zhang、He 与 Yao,《From Citation Selection to Citation Absorption》,arXiv:2604.25707(预印本,仅描述性统计);602 条受控 prompt,21,143 条搜索层引用。arxiv.org/abs/2604.25707
- Vishwakarma 等,2026;252,000 次试验的因子实验,发现明确价格与近期日期存在效应,而仅改格式的效应很弱(见出处 4 的综述转述)
- Grossman 等,SIGIR 2026;11,500 条查询;Google 自然结果、AI Overviews 与 Gemini 之间 URL 层面的 Jaccard 为 0.11–0.18。arxiv.org/abs/2604.27790
- Sielinski,《Quantifying Uncertainty in AI Visibility》,2026 年 3 月,arXiv:2603.08924(预印本)。arxiv.org/abs/2603.08924
- 某厂商配对对照研究:1,885 个在 2025 年 8 月至 2026 年 3 月之间新增 JSON-LD 的页面,对照 4,000 个未新增的页面,在前后各 30 天窗口内测量引用,2026 年 5 月发布;AI Overviews 引用 −4.6%(显著),另外两个平台不显著。厂商发布;按本课程的出处规则,只转述不外链。
你想知道的,都在这里。
那篇 GEO 论文里著名的“提升 40%”是真的吗?
它是一篇真实论文里的一个真实数字,而且不具备普适性,这正是 2026 年那篇批判性综述把它列入“作为泛化说法被否定”的原因。这个数字是某个自定义指标(位置加权词数,衡量答案文本中有多少被归给你的来源)从基线 19.3 到 27.2 的相对距离,测量环境是一个由五条 Google 结果加一个 2023 年代模型搭起来的合成引擎,而被优化的文档本来就在上下文里。引用它时必须带上这些条件,否则就别引用。
我该往页面里加统计数字和引文吗?
加真实的,带真实出处和真实日期,并且预期是中等而非戏剧性的效果。“可抽取的证据”是 2026 年那篇综述唯一评为中到强支撑的内容杠杆,而它的条件是硬性的:判断标准不是“加数字”,而是提供相关、可核实、有日期、且正确归因的证据。这个技巧诱发的失败模式,恰恰是那篇开创性论文自己的示例掉进去的那个:编造一个“看起来像引用”的出处,指向一个并不存在的机构。引擎核查不了,而读者终究会。
我的页面已经排第一,还需要为 AI 答案改写它吗?
在已经排第一的来源上,实测效果是负的,所以在那里请把激进的“答案化”改写视为下行风险。那篇开创性论文的分排名表格显示,标注出处、加入引语和加入统计数字这三种方法,会让排名第一的来源可见度下降 20–30%,同时让排名第五的来源大约翻倍;机制是在固定候选集内部的再分配,而不是增长。请为准确性、时效性和清晰度去编辑这些页面,把结构性的花招留给那些还没赢下这条查询的页面。
如果大多数技巧都没用,那还剩下什么可做?
三件事,按顺序:真正成为这个问题的最佳答案;赢得能把你放进检索上下文靠前位置的排名;以及在正文里放上真实、有日期、有归因的证据。这是 2026 年那篇综述评级高于“弱”的仅有几个杠杆,而前两件本就是普通的搜索工作,不是什么新东西。剩下的部分在站外:在商业类问题上,被引用的内容很大一部分是第三方报道和社区帖子,而不是任何厂商自己的页面,那是另一条预算线,也是另一个团队。
负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。
发现数字有误?告诉我们,我们会重新核查:support@bavior.com