只有前四行会改变你周一要做的事:单位改变你编辑什么,界面改变“赢”长什么样,扇出改变你瞄准什么,回报改变你向董事会承诺什么。后三行改变的是你怎么报告、怎么写。
这张表里没有出现的,是对上游那一半工作的任何改变。相关性、收录和话题覆盖没有变,仍然决定你是否具备资格;那一侧属于GEO 与 SEO这一阶段 与“哪些东西沿用”专题。下面的一切都在它的下游。
工作单位变成了段落。竞争界面变成了一个答案,而不是十条链接。回报也从点击变成了提及:皮尤追踪了 68,879 次真实搜索,发现人们点击 AI 摘要内来源的比例约为 1%。
当一个答案引擎坐在你和读者之间时,有三件事真的变了:竞争单位从一份文档变成一段文字,界面从十条排序链接变成一个合成答案,回报从一次访问变成一次提及。由此还带出另外两个变化,因为结果并不稳定,而且你不再控制别人怎么描述你。皮尤研究中心追踪了 900 多名美国成年人在 2025 年 3 月的 68,879 次 Google 搜索,发现出现 AI 摘要时用户点击结果的比例是 8%、未出现时是 15%,而点击摘要内来源的比例约为 1%。1
要点速览单位、界面和回报改变的是工作本身。稳定性与表述准确度改变的是报告方式和写法。
| 经典搜索 | AI 答案引擎 | |
|---|---|---|
| 竞争单位 | 整个页面 | 一个段落;被高亮段落中位数约 117 词 |
| 用户看到什么 | 十条排序链接 | 一个合成答案 |
| 你竞争的查询 | 用户敲进去的那一条 | 你根本看不到的若干条扇出子查询 |
| 回报 | 一次点击 | 一次提及;约 1% 会点开摘要内的来源 |
| 结果稳定性 | 稳定到可以每天跟踪排名 | 重复运行的 Jaccard 重合度 0.34–0.42 |
| 跨界面一致性 | 一个索引,一套结果 | 同一家公司三个界面之间 URL Jaccard 仅 0.11–0.18 |
| 你被如何描述 | 你自己的标题与摘要 | 转述;受测回答中超过 60% 含有错误 |
只有前四行会改变你周一要做的事:单位改变你编辑什么,界面改变“赢”长什么样,扇出改变你瞄准什么,回报改变你向董事会承诺什么。后三行改变的是你怎么报告、怎么写。
这张表里没有出现的,是对上游那一半工作的任何改变。相关性、收录和话题覆盖没有变,仍然决定你是否具备资格;那一侧属于GEO 与 SEO这一阶段 与“哪些东西沿用”专题。下面的一切都在它的下游。
工作单位之所以是段落,是因为引擎引用的是一段文字、并丢掉页面其余部分;而在至少一个界面上,你能确切看到它引的是哪一段。已发表的最大规模段落级数据集,是一项为期一年、覆盖 148 个行业、15,699,298 条 Google AI Mode 引用的厂商研究,解析出 270 万个页面上的 460 万段独立高亮文字,发布于 2026 年 7 月。厂商发布;按本课程的出处规则,只描述、不链接。7
它的数字描述了“一段被引用的文字长什么样”。47.7% 的引用是滚动定位高亮而非普通链接,也就是说引擎指向了某一个具体段落。被高亮段落的中位数是 117 词。80% 把答案放在第一句,约 85% 完全自成一体,即脱离所在页面也能看懂,而被反复引用的段落里有 48% 以一个明确的问句开头,一次性段落中这个比例是 22%。同一份数据也显示排名仍然统辖全局:提供 21 段及以上高亮文字的页面,自然排名中位数为 1;而在被复用 100 次以上的段落里,76% 来自排第一的页面。
由此得出的编辑结论不依赖你相信那些百分比。把每一节都写成“被摘出来、没有任何上下文时依然成立”,因为那是它唯一会被使用的形态:一个问句形式的标题、答案放在标题下的第一句、每个限定条件写进句子本身而不是上一段。像“这意味着”这样的开头,在结构上就是不可被引用的。
不是读者敲进去的那一条,因为引擎会自己发起若干次搜索,而你完全看不到它们。Google 在自家界面的文档里写明:AI Overviews 与 AI Mode 都“可能使用‘查询扇出’技术”,并把它描述为“围绕子话题与多个数据源发起多次相关搜索”来组织回答。8 于是一个问题会变成若干次彼此独立的检索,你的页面要在每一次里被单独判定。
读者随后看到的是一个合成答案,而不是十条排序链接,这让行业赖以汇报的“位置”词汇失效了:没有第三名可占,而“唯一被引用的来源”和“第七个被引用的来源”在你的分析后台里长得一模一样。底层的资格规则则完全没变:Google 对支撑链接的明文要求是,页面“必须已被收录、且可在 Google 搜索中带摘要展示,并满足搜索的技术要求”,并且它说除此之外没有额外的技术要求。8
规划上由此推出两件事。关键词与页面的映射不再是一对一,所以请把内容覆盖建立在一个话题所隐含的子问题上,而不是建立在头部词上,因为被真正搜索的是那些子问题。以及,不要再把“没有被引用”读作排名下滑:你看不到引擎发出了哪些子查询,而一条答案可能是用你的页面从来都不构成候选的查询拼出来的。Grossman 等发现,在 11,500 条真实用户查询中,有 51.5% 的查询里 AI Overview 出现在自然结果之上,所以这是常态路径,不是边缘情况。3
按目前唯一一份已发表的独立行为测量看,远少于一个排名。
一次 AI 引用产生品牌曝光的可靠性,远高于它产生一次会话的可靠性。皮尤研究中心追踪了 900 多名美国成年人在 2025 年 3 月的真实浏览行为,共 68,879 次 Google 搜索,其中 12,593 次返回了 AI 摘要。出现摘要时,用户点击任意结果的比例是 8%,未出现时是 15%。点击摘要内被引用来源的比例约为 1%。而且他们更可能干脆停止浏览:访问带摘要页面的会话有 26% 就此结束,无摘要时为 16%。1
这是一家没有产品要卖的研究机构给出的行为面板数据,这使它成为本阶段中最强的证据。学术文献在不确定性的方向上与之一致:2026 年批判性综述把“引用分数能预测点击、转化或收入”评为极低置信度,是它最低的一档。2
报告方式的改变由此直接推出。把引用当作高意图时刻的曝光来计数,与你其他的品牌认知指标并列,别再把它们和自然会话放进同一张表。任何按某个假定比例把引用换算成访问的预测,都是建立在这个领域已被明确评为“无证据”的那件事之上。
你过去用排名跟踪器做的一切,都要重建为重复采样,因为同一条 prompt 问两遍,返回的来源集合“有重叠但不相同”。2026 年批判性综述报告:同一查询在商用引擎上重复运行的重合度为 Jaccard 0.34–0.42,在可调温度的界面上有 9–28% 的重复判定会变化,并直白地写出后果:“可见性是一个分布……点估计不是一个稳定指标。”2
跨界面的不稳定比跨运行更严重。Grossman 等(SIGIR 2026)在 11,500 条查询上测得 Google 自然结果、AI Overviews 与 Gemini 之间的 URL 级 Jaccard 相似度为 0.11–0.18:同一家公司的三个界面,对“哪些 URL 回答了这个问题”基本意见不一。3 Li 与 Sinnamon(2024)审计了 1,008 个生成式搜索回答,发现两个引擎共引用的 355 个独立域名中,只有 26% 同时出现在两边。4 综述的结论是,这些结果“否定了存在一个全局 GEO 排名的说法”。
由此得出三个习惯。对每条 prompt 在一段时间内多次采样,而不是只跑一次。按引擎分别报告,绝不把多个引擎混成一个分数。以及,把任何小于你自己实测的运行间方差的差异,一律当作没有差异,因为在 Jaccard 0.34–0.42 的水平上,大多数周环比波动都是噪声。
你会被一个有实测错误率的系统转述,于是“准确”不再是你拥有的东西,而只是你能让它变得更容易的东西。哥伦比亚大学 Tow 数字新闻中心在 2025 年 3 月跨八个引擎测试了 1,600 条查询,取自 20 家出版商、每家 10 篇文章,发现超过 60% 返回了错误答案。差距很大:一个引擎有 94% 的时候是错的,在它测试的 200 条提示词中产生了 154 条指向错误页面的引用;而表现最好的那个也有 37% 是错的。与模型提供方签订的授权协议并不保证被准确引用,而屏蔽了爬虫的出版商照样被引用。5
Tow 中心 2024 年 11 月更早的一项研究,取了 20 家出版商的 200 段直接引文,要求某个引擎指出它们的出处:200 个回答里有 153 个部分或完全错误,而系统只有 7 次表达了不确定。6 学术工作在答案内部发现了同样的弱点:Liu 等(2023)发现生成式搜索答案中只有 51.5% 的句子被其引用完全支撑;而 2026 年一项研究把 98,020 条原子性论断中约 11% 归类为支撑不足。2
这一点你无法从自己这边修好。你能做的是降低暴露,而方法与段落数据所指向的那一条相同:写出被单独引用时依然成立的句子。把限定条件放进句子里,而不是放在它的前一句;把日期写进论断本身;把来源写进正文,而不只写在脚注里。一句只有在上下文中才成立的话,早晚会被脱离上下文引用。
皮尤那组数字只描述 Google、只描述美国成年人、只描述 2025 年 3 月;而 1% 特指“人们点击摘要内被引用来源”的比率,不是某个站点的 AI 总体引荐率,后者没有任何独立研究测量过。ChatGPT、Perplexity 或 Copilot 都没有可比的行为面板,所以本页“回报”那一行建立在一个引擎、一个月份之上。段落级的那些百分比出自厂商、属于相关性数据,而且缺少基线:该研究没有报告全网段落中有多大比例本来就是“答案前置”,所以它印证了一个合理机制,而不是证明了它。
这里五个变化里有四个靠编辑就能解决,不用花钱买:把最高意图的小节改写成自成一体、把内容覆盖建立在子问题而不是头部词上、把引用从流量预测挪进品牌报告、把每个限定条件写进它所限定的那句话。只有“稳定性”这一项需要机器,因为靠人工把一条 prompt 每周在五个引擎上跑好几次,没人能坚持到第三个月。Bavior 按计划跑一组固定 prompt 并记录每个答案引用了哪些来源,让真实变动从噪声里分离出来。它无法纠正关于你的错误陈述,也不对引用或流量作任何承诺。先试免费可见性检测;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 29 日)。
按已发表的唯一独立行为数据看,远少于一个排名带来的流量。皮尤研究中心追踪了 900 多名美国成年人在 2025 年 3 月的 68,879 次 Google 搜索,发现出现 AI 摘要时用户点击任意结果的比例是 8%,没有摘要时是 15%;而点击摘要内被引用来源的比例约为 1%。他们也更常直接结束会话:有摘要的页面为 26%,无摘要为 16%。请把一次引用视为高意图时刻的一次品牌曝光,而不是一个流量来源。
是段落,不是页面。已发表的最大规模段落级数据集,是一项为期一年、覆盖 1,570 万条 Google AI Mode 引用的厂商研究,解析出 270 万个页面上 460 万段独立高亮文字。它发现 47.7% 的引用是指向特定段落的滚动定位高亮,被高亮段落的中位数为 117 词,80% 把答案放在第一句,约 85% 完全自成一体。由此得出的实用规则并不依赖这些百分比:把每一节都写成“被零上下文摘走也依然成立”。
是它自己生成的若干条,而不是用户敲进去的那一条。Google 在文档里写明,AI Overviews 与 AI Mode 都可能使用“查询扇出”技术,也就是围绕子话题和多个数据源发起多次相关搜索来组织回答。因此一个问题会变成若干次彼此独立的检索,你的页面要在每一次里分别竞争。两个后果:把内容覆盖建立在一个话题所隐含的子问题上,而不是建立在头部词上;以及不要再把“没被引用”读作排名下滑,因为你根本看不到引擎发出了哪些子查询。
因为测量本身有噪声,而不是因为你的可见性变了。2026 年批判性综述报告:同一查询在商用引擎上重复运行的重合度为 Jaccard 0.34–0.42,9–28% 的重复判定会发生变化,并得出结论:“可见性是一个分布……点估计不是一个稳定指标。”跨界面的情况更糟:在 11,500 条查询上,Google 自然结果、AI Overviews 与 Gemini 之间的 URL 级 Jaccard 只有 0.11–0.18。请对每条 prompt 多次采样、按引擎分别报告,并把小于你实测方差的变动一律当作没有变动。
不能,而且错误率高到必须提前把它算进计划里。哥伦比亚大学 Tow 中心在 2025 年 3 月跨八个引擎测试了 1,600 条查询,发现超过 60% 返回了错误答案;其中一个引擎有 94% 的时候是错的,在它测试的 200 条提示词中产生了 154 条指向错误页面的引用。与模型提供方签订的授权协议,并不保证被准确引用。你能控制的是自己的暴露程度:把每个限定条件写进它所限定的那句话里、把日期写进论断本身、把来源写进正文而不只是脚注,好让一段被单独摘走的文字依然成立。
三件。停止用引用去预测会话量,因为 2026 年批判性综述把“引用分数能预测点击、转化或收入”评为极低置信度,是它最低的一档。停止上报单一的综合“AI 可见性”分数,因为同一家公司三个界面之间的 URL 重合度只有 Jaccard 0.11–0.18。以及停止把单次 prompt 运行当成测量,因为同一查询的重复运行重合度是 Jaccard 0.34–0.42,这让大多数周环比变动与噪声无法区分。
负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。
发现数字有误?告诉我们,我们会重新核查:support@bavior.com