首页/学习 GEO/GEO 改变了什么
GEO 与 SEO · 专题

GEO 改变了什么:三个真实的差别,不是三句口号。

工作单位变成了段落。竞争界面变成了一个答案,而不是十条链接。回报也从点击变成了提及:皮尤追踪了 68,879 次真实搜索,发现人们点击 AI 摘要内来源的比例约为 1%。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

当一个答案引擎坐在你和读者之间时,有三件事真的变了:竞争单位从一份文档变成一段文字,界面从十条排序链接变成一个合成答案,回报从一次访问变成一次提及。由此还带出另外两个变化,因为结果并不稳定,而且你不再控制别人怎么描述你。皮尤研究中心追踪了 900 多名美国成年人在 2025 年 3 月的 68,879 次 Google 搜索,发现出现 AI 摘要时用户点击结果的比例是 8%、未出现时是 15%,而点击摘要内来源的比例约为 1%。1

要点速览
  • 要编辑的是段落,不是页面。引擎引用一段文字、丢掉其余部分,所以每一节都必须在“被摘出来、没有任何上下文”时依然成立。
  • 把引用当作品牌曝光,而不是流量。在皮尤的行为面板上,约 1% 的访问产生了对 AI 摘要内来源的点击。1
  • 瞄准子问题,而不是头部词。Google 说 AI Overviews 与 AI Mode 都可能发起多次你看不到的相关搜索,于是一个问题会变成若干次彼此独立的检索。8
  • 多次采样,并按引擎分别报告。同一查询重复运行的重合度是 Jaccard 0.34–0.42,同一家公司三个界面之间只有 0.11–0.18。2
  • 默认你会被转述错。跨八个引擎的 1,600 条受测回答里超过 60% 是错的,所以把每个限定条件都写进它所限定的那句话。5
整体形状

哪三件事是真正改变了的?

单位、界面和回报改变的是工作本身。稳定性与表述准确度改变的是报告方式和写法。

经典搜索AI 答案引擎
竞争单位整个页面一个段落;被高亮段落中位数约 117 词
用户看到什么十条排序链接一个合成答案
你竞争的查询用户敲进去的那一条你根本看不到的若干条扇出子查询
回报一次点击一次提及;约 1% 会点开摘要内的来源
结果稳定性稳定到可以每天跟踪排名重复运行的 Jaccard 重合度 0.34–0.42
跨界面一致性一个索引,一套结果同一家公司三个界面之间 URL Jaccard 仅 0.11–0.18
你被如何描述你自己的标题与摘要转述;受测回答中超过 60% 含有错误

只有前四行会改变你周一要做的事:单位改变你编辑什么,界面改变“赢”长什么样,扇出改变你瞄准什么,回报改变你向董事会承诺什么。后三行改变的是你怎么报告、怎么写。

这张表里没有出现的,是对上游那一半工作的任何改变。相关性、收录和话题覆盖没有变,仍然决定你是否具备资格;那一侧属于GEO 与 SEO这一阶段“哪些东西沿用”专题。下面的一切都在它的下游。

变化一

为什么工作单位是段落而不是页面?

工作单位之所以是段落,是因为引擎引用的是一段文字、并丢掉页面其余部分;而在至少一个界面上,你能确切看到它引的是哪一段。已发表的最大规模段落级数据集,是一项为期一年、覆盖 148 个行业、15,699,298 条 Google AI Mode 引用的厂商研究,解析出 270 万个页面上的 460 万段独立高亮文字,发布于 2026 年 7 月。厂商发布;按本课程的出处规则,只描述、不链接。7

它的数字描述了“一段被引用的文字长什么样”。47.7% 的引用是滚动定位高亮而非普通链接,也就是说引擎指向了某一个具体段落。被高亮段落的中位数是 117 词。80% 把答案放在第一句,约 85% 完全自成一体,即脱离所在页面也能看懂,而被反复引用的段落里有 48% 以一个明确的问句开头,一次性段落中这个比例是 22%。同一份数据也显示排名仍然统辖全局:提供 21 段及以上高亮文字的页面,自然排名中位数为 1;而在被复用 100 次以上的段落里,76% 来自排第一的页面。

由此得出的编辑结论不依赖你相信那些百分比。把每一节都写成“被摘出来、没有任何上下文时依然成立”,因为那是它唯一会被使用的形态:一个问句形式的标题、答案放在标题下的第一句、每个限定条件写进句子本身而不是上一段。像“这意味着”这样的开头,在结构上就是不可被引用的。

变化二

你到底在跟哪一条查询竞争?

不是读者敲进去的那一条,因为引擎会自己发起若干次搜索,而你完全看不到它们。Google 在自家界面的文档里写明:AI Overviews 与 AI Mode 都“可能使用‘查询扇出’技术”,并把它描述为“围绕子话题与多个数据源发起多次相关搜索”来组织回答。8 于是一个问题会变成若干次彼此独立的检索,你的页面要在每一次里被单独判定。

读者随后看到的是一个合成答案,而不是十条排序链接,这让行业赖以汇报的“位置”词汇失效了:没有第三名可占,而“唯一被引用的来源”和“第七个被引用的来源”在你的分析后台里长得一模一样。底层的资格规则则完全没变:Google 对支撑链接的明文要求是,页面“必须已被收录、且可在 Google 搜索中带摘要展示,并满足搜索的技术要求”,并且它说除此之外没有额外的技术要求。8

规划上由此推出两件事。关键词与页面的映射不再是一对一,所以请把内容覆盖建立在一个话题所隐含的子问题上,而不是建立在头部词上,因为被真正搜索的是那些子问题。以及,不要再把“没有被引用”读作排名下滑:你看不到引擎发出了哪些子查询,而一条答案可能是用你的页面从来都不构成候选的查询拼出来的。Grossman 等发现,在 11,500 条真实用户查询中,有 51.5% 的查询里 AI Overview 出现在自然结果之上,所以这是常态路径,不是边缘情况。3

变化三

一次 AI 引用到底能带来多少流量?

按目前唯一一份已发表的独立行为测量看,远少于一个排名。

8%有摘要时的点击率没有摘要时为 15%
1%点击被引用来源AI 摘要内部
26%直接结束会话没有摘要时为 16%
68,879次搜索被追踪900+ 名美国成年人,2025 年 3 月

一次 AI 引用产生品牌曝光的可靠性,远高于它产生一次会话的可靠性。皮尤研究中心追踪了 900 多名美国成年人在 2025 年 3 月的真实浏览行为,共 68,879 次 Google 搜索,其中 12,593 次返回了 AI 摘要。出现摘要时,用户点击任意结果的比例是 8%,未出现时是 15%。点击摘要内被引用来源的比例约为 1%。而且他们更可能干脆停止浏览:访问带摘要页面的会话有 26% 就此结束,无摘要时为 16%。1

这是一家没有产品要卖的研究机构给出的行为面板数据,这使它成为本阶段中最强的证据。学术文献在不确定性的方向上与之一致:2026 年批判性综述把“引用分数能预测点击、转化或收入”评为极低置信度,是它最低的一档。2

报告方式的改变由此直接推出。把引用当作高意图时刻的曝光来计数,与你其他的品牌认知指标并列,别再把它们和自然会话放进同一张表。任何按某个假定比例把引用换算成访问的预测,都是建立在这个领域已被明确评为“无证据”的那件事之上。

变化四

答案不稳定,让测量方式发生了什么变化?

你过去用排名跟踪器做的一切,都要重建为重复采样,因为同一条 prompt 问两遍,返回的来源集合“有重叠但不相同”。2026 年批判性综述报告:同一查询在商用引擎上重复运行的重合度为 Jaccard 0.34–0.42,在可调温度的界面上有 9–28% 的重复判定会变化,并直白地写出后果:“可见性是一个分布……点估计不是一个稳定指标。”2

跨界面的不稳定比跨运行更严重。Grossman 等(SIGIR 2026)在 11,500 条查询上测得 Google 自然结果、AI Overviews 与 Gemini 之间的 URL 级 Jaccard 相似度为 0.11–0.18:同一家公司的三个界面,对“哪些 URL 回答了这个问题”基本意见不一。3 Li 与 Sinnamon(2024)审计了 1,008 个生成式搜索回答,发现两个引擎共引用的 355 个独立域名中,只有 26% 同时出现在两边。4 综述的结论是,这些结果“否定了存在一个全局 GEO 排名的说法”。

由此得出三个习惯。对每条 prompt 在一段时间内多次采样,而不是只跑一次。按引擎分别报告,绝不把多个引擎混成一个分数。以及,把任何小于你自己实测的运行间方差的差异,一律当作没有差异,因为在 Jaccard 0.34–0.42 的水平上,大多数周环比波动都是噪声。

变化五

不再控制别人怎么描述你,这带来了什么变化?

你会被一个有实测错误率的系统转述,于是“准确”不再是你拥有的东西,而只是你能让它变得更容易的东西。哥伦比亚大学 Tow 数字新闻中心在 2025 年 3 月跨八个引擎测试了 1,600 条查询,取自 20 家出版商、每家 10 篇文章,发现超过 60% 返回了错误答案。差距很大:一个引擎有 94% 的时候是错的,在它测试的 200 条提示词中产生了 154 条指向错误页面的引用;而表现最好的那个也有 37% 是错的。与模型提供方签订的授权协议并不保证被准确引用,而屏蔽了爬虫的出版商照样被引用。5

Tow 中心 2024 年 11 月更早的一项研究,取了 20 家出版商的 200 段直接引文,要求某个引擎指出它们的出处:200 个回答里有 153 个部分或完全错误,而系统只有 7 次表达了不确定。6 学术工作在答案内部发现了同样的弱点:Liu 等(2023)发现生成式搜索答案中只有 51.5% 的句子被其引用完全支撑;而 2026 年一项研究把 98,020 条原子性论断中约 11% 归类为支撑不足。2

这一点你无法从自己这边修好。你能做的是降低暴露,而方法与段落数据所指向的那一条相同:写出被单独引用时依然成立的句子。把限定条件放进句子里,而不是放在它的前一句;把日期写进论断本身;把来源写进正文,而不只写在脚注里。一句只有在上下文中才成立的话,早晚会被脱离上下文引用。

本页诚实的局限

皮尤那组数字只描述 Google、只描述美国成年人、只描述 2025 年 3 月;而 1% 特指“人们点击摘要内被引用来源”的比率,不是某个站点的 AI 总体引荐率,后者没有任何独立研究测量过。ChatGPT、Perplexity 或 Copilot 都没有可比的行为面板,所以本页“回报”那一行建立在一个引擎、一个月份之上。段落级的那些百分比出自厂商、属于相关性数据,而且缺少基线:该研究没有报告全网段落中有多大比例本来就是“答案前置”,所以它印证了一个合理机制,而不是证明了它。

产品在哪里派得上用场,在哪里派不上

这里五个变化里有四个靠编辑就能解决,不用花钱买:把最高意图的小节改写成自成一体、把内容覆盖建立在子问题而不是头部词上、把引用从流量预测挪进品牌报告、把每个限定条件写进它所限定的那句话。只有“稳定性”这一项需要机器,因为靠人工把一条 prompt 每周在五个引擎上跑好几次,没人能坚持到第三个月。Bavior 按计划跑一组固定 prompt 并记录每个答案引用了哪些来源,让真实变动从噪声里分离出来。它无法纠正关于你的错误陈述,也不对引用或流量作任何承诺。先试免费可见性检测;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 29 日)。

出处,全部核查于 2026 年 8 月 30 日
  1. 皮尤研究中心,《Google users are less likely to click on links when an AI summary appears in the results》,2025 年 7 月 22 日;追踪 900 多名美国成年人、2025 年 3 月的 68,879 次搜索,其中 12,593 次带 AI 摘要:pewresearch.org
  2. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(预印本);置信度表、运行间方差,以及 Liu 等与 Xu 等的支撑度数据:arxiv.org/abs/2607.14035
  3. Grossman 等,SIGIR 2026;11,500 条查询;其中 51.5% 的查询里 AI Overview 位于自然结果之上;Google 自然结果、AI Overviews 与 Gemini 之间 URL 级 Jaccard 0.11–0.18:arxiv.org/abs/2604.27790
  4. Li 与 Sinnamon,2024;对 1,008 个生成式搜索回答的审计;355 个独立域名,26% 被两个系统同时引用。经批判性综述(出处 2)转引;核查时无开放获取链接。
  5. Jaźwińska 与 Chandrasekar,《AI Search Has a Citation Problem》,哥伦比亚大学 Tow 数字新闻中心,2025 年 3 月 6 日;1,600 条查询、20 家出版商、8 个引擎:cjr.org
  6. Tow 数字新闻中心,《How ChatGPT Search (Mis)represents Publisher Content》,2024 年 11 月 27 日;20 家出版商的 200 段引文:cjr.org
  7. 段落级数据:某厂商为期一年、覆盖 148 个行业、15,699,298 条 Google AI Mode 引用的研究,解析出 270 万个页面上的 460 万段独立高亮文字,发布于 2026 年 7 月 29 日。厂商发布;按本课程的出处规则,只描述、不链接。
  8. Google Search Central,《AI features and your website》,最后更新于 2025 年 12 月 10 日(第一方;查询扇出与收录要求):developers.google.com/search/docs/appearance/ai-features
常见问题

你想知道的,都在这里。

AI 引用能带来流量吗?

按已发表的唯一独立行为数据看,远少于一个排名带来的流量。皮尤研究中心追踪了 900 多名美国成年人在 2025 年 3 月的 68,879 次 Google 搜索,发现出现 AI 摘要时用户点击任意结果的比例是 8%,没有摘要时是 15%;而点击摘要内被引用来源的比例约为 1%。他们也更常直接结束会话:有摘要的页面为 26%,无摘要为 16%。请把一次引用视为高意图时刻的一次品牌曝光,而不是一个流量来源。

AI 搜索里的优化单位是什么?

是段落,不是页面。已发表的最大规模段落级数据集,是一项为期一年、覆盖 1,570 万条 Google AI Mode 引用的厂商研究,解析出 270 万个页面上 460 万段独立高亮文字。它发现 47.7% 的引用是指向特定段落的滚动定位高亮,被高亮段落的中位数为 117 词,80% 把答案放在第一句,约 85% 完全自成一体。由此得出的实用规则并不依赖这些百分比:把每一节都写成“被零上下文摘走也依然成立”。

AI 答案引擎实际去搜的是哪一条查询?

是它自己生成的若干条,而不是用户敲进去的那一条。Google 在文档里写明,AI Overviews 与 AI Mode 都可能使用“查询扇出”技术,也就是围绕子话题和多个数据源发起多次相关搜索来组织回答。因此一个问题会变成若干次彼此独立的检索,你的页面要在每一次里分别竞争。两个后果:把内容覆盖建立在一个话题所隐含的子问题上,而不是建立在头部词上;以及不要再把“没被引用”读作排名下滑,因为你根本看不到引擎发出了哪些子查询。

为什么 AI 可见性的数字每周都在大幅波动?

因为测量本身有噪声,而不是因为你的可见性变了。2026 年批判性综述报告:同一查询在商用引擎上重复运行的重合度为 Jaccard 0.34–0.42,9–28% 的重复判定会发生变化,并得出结论:“可见性是一个分布……点估计不是一个稳定指标。”跨界面的情况更糟:在 11,500 条查询上,Google 自然结果、AI Overviews 与 Gemini 之间的 URL 级 Jaccard 只有 0.11–0.18。请对每条 prompt 多次采样、按引擎分别报告,并把小于你实测方差的变动一律当作没有变动。

我能控制 AI 引擎怎么描述我的品牌吗?

不能,而且错误率高到必须提前把它算进计划里。哥伦比亚大学 Tow 中心在 2025 年 3 月跨八个引擎测试了 1,600 条查询,发现超过 60% 返回了错误答案;其中一个引擎有 94% 的时候是错的,在它测试的 200 条提示词中产生了 154 条指向错误页面的引用。与模型提供方签订的授权协议,并不保证被准确引用。你能控制的是自己的暴露程度:把每个限定条件写进它所限定的那句话里、把日期写进论断本身、把来源写进正文而不只是脚注,好让一段被单独摘走的文字依然成立。

答案取代链接之后,哪些指标该停掉?

三件。停止用引用去预测会话量,因为 2026 年批判性综述把“引用分数能预测点击、转化或收入”评为极低置信度,是它最低的一档。停止上报单一的综合“AI 可见性”分数,因为同一家公司三个界面之间的 URL 重合度只有 Jaccard 0.11–0.18。以及停止把单次 prompt 运行当成测量,因为同一查询的重复运行重合度是 Jaccard 0.34–0.42,这让大多数周环比变动与噪声无法区分。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

把引用当作曝光来报告。
把段落写成能独立成立。

免费试用