首页/学习 GEO/引擎是否一致
AI 搜索如何工作 · 专题

AI 引擎在“引用谁”上意见一致吗?三项学术审计说:基本不一致。

同一个问题问两个助手,返回的来源大体不同;而同一家公司基于同一索引做出来的两个界面,同样如此。这一个事实就决定了 AI 可见性必须怎么测、怎么报。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

AI 引擎在“引用谁”上基本不一致,所以某个引擎上的一次引用,对其他引擎来说是很弱的证据。最刺眼的一项测量来自同一家公司基于同一索引做出的三个界面:SIGIR 2026 上发表的一项 11,500 条查询的研究报告称,Google 自然结果、AI Overviews 与 Gemini 之间 URL 层面的平均 Jaccard 相似度低于 0.2。1

关键要点
  • Jaccard 是交集除以并集,不是“你被引用的 URL 占比”。0.18 意味着两个界面返回的来源合起来,只有 18% 是两边都返回的。
  • 分化在内容质量被评判之前就开始了:引擎用不同的令牌抓取网页,把问题展开成不同的子查询,引用的来源数量和类型也不同。
  • 单一的综合 AI 可见性分数,恰好盖掉了唯一可执行的信息。请按“一个引擎一个界面一行”来报,写明日期与语区,行与行之间不做任何算术。
几项测量

两个 AI 引擎的重合度到底有多少?

两个 AI 引擎之间的重合,比大多数人以为的小得多:哪怕是同一家公司基于同一索引构建的两个界面,URL 层面的 Jaccard 也只有 0.11 到 0.18;而在唯一测过这件事的那项审计里,两个互不相干的助手只共享了 26% 的域名。

四项独立的学术测量,方法各异、分母各异、采集时间窗也各异。先读最后两列,再读数字。

研究样本与采集时间窗结论它测的是什么
Grossman 等,SIGIR 202611,500 条查询URL Jaccard 0.11–0.18Google 自然结果、AI Overviews 与 Gemini 之间的集合重合
Kirsten 等,Findings of ACL 20264,706 条查询,2025 年 9 月采集53% 不在自然结果前十;27% 不在前一百按 AI Overviews 查阅过的域名计,对同一查询的自然结果
Xu、Iqbal 与 Montgomery,2026 预印本55,393 条查询,2026 年 3 月 13 日至 4 月 21 日采集29.8% 不在自然结果首页上按 AI Overview 引述的域名计,对同一查询的首页
Li 与 Sinnamon,2024672 条回答,355 个唯一域名26% 被两者共同引用两个助手之间的域名重合

2026 年的批判性综述用一句值得原样引用的话下了结论:这些结果“否定了存在全局 GEO 排名的观念。可见性是按引擎和按界面索引的。”4 根本不存在“你的 AI 搜索位次”这样一个对象。存在的是五六个位次,彼此只有松散相关。两个毫不相干的助手之间,差距还要更大:2024 年那项对 Bing Chat 与 Perplexity 的审计发现,它看到的域名里有 74% 只被其中一个引用过。3

怎么读这个数字

0.15 的 Jaccard 到底意味着什么?

Jaccard 相似度是交集的大小除以并集的大小,这和“你被引用的 URL 占比”是两个不同的量,却经常被当成同一件事转述。如果对同一个查询,AI Overviews 引用了十个 URL、Gemini 也引用了十个,0.15 的重合度意味着大约有三个 URL 同时出现在两边,两边合起来约有十七个不同的 URL。Grossman 等对重合最高的那一对给出了自己的说法:“平均而言,AIO 或传统 SERP 返回的来源中,只有 18% 会被两个搜索引擎同时检索到。”1

这三对的糟糕程度并不相同,而摘要不会告诉你这一点。摘要只给出“平均 Jaccard 相似度小于 0.2”;两两之间的具体值在表 2 里:AI Overviews 对自然结果是 0.18,自然结果对 Gemini 是 0.16,AI Overviews 对 Gemini 是 0.11。1 大多数人当成可以互换的那一对,也就是两个生成式界面,恰恰是最不一致的一对。

靠重复测量也救不回来。那篇批判性综述转述 Schulte 等的结果:在四个引擎、45 天里,按天计的来源层面 Jaccard 约为 0.34 到 0.42,24 小时内的重复测量水平也差不多;综述正是据此建议每条 prompt 跑七到八次。11 请把这个数字连同它的限制一起读:综述写明该结论来自一个很小的瑞士查询集合。即便如此,已发表的最紧的一种比较,也没有到一半。

机制

读的是同一个网络,为什么分歧这么大?

引擎之所以互不一致,是因为在“内容质量”被考虑之前就已经有四件事不同:怎么抓取、怎么展开问题、引用多少来源、偏好哪种来源。

这四种差异叠加在一起,没有一种是你能一次性为所有引擎修好的。

01

它们读到的不是同一个网络

每个引擎用自己的令牌抓取,各家厂商分别写在文档里:OpenAI 把 GPTBot 与 OAI-SearchBot 分开,Anthropic 把 ClaudeBot 与 Claude-SearchBot 分开,Google 把 Google-Extended 与 Googlebot 分开。5 一条 robots.txt 规则挡住其中一个,其余不受影响,所以在排序开始之前,候选池就已经不同了。

02

它们展开问题的方式不同

Google 的文档写明,AI Overviews 和 AI Mode 可能使用“查询扇出”技术,跨子话题与数据源发起多次相关搜索来生成回答。6 子查询是各引擎各自生成的,所以在任何一方开始排序之前,两个引擎检索的其实是不同的问题。

03

它们的引用预算不同

在 602 条受控 prompt 上,每条回答的平均引用数为:ChatGPT 6.88,Google 的 AI 界面 12.06,Perplexity 16.35。7 引用 16 个来源的引擎会比引用 7 个的引擎在候选清单上探得更深,所以边缘位置上的那个来源天然就不一样。

04

它们偏好的来源类型不同

在同一份数据集中,论文标为“官方”的来源占 ChatGPT 引用的 34.22%,占 Google 的 46.35%;而新闻类在 ChatGPT 是 31.17%,在 Google 是 18.99%。7 一个页面对某个引擎是“对的类型”,对另一个引擎可能就是“错的类型”。

这四种差异是相乘而不是相互抵消的,这就是观测到的重合度如此之低的原因。它也解释了大多数团队当成谜题的一种现象:一个页面可以被某个引擎持续引用、在另一个引擎里从不出现,而页面本身没有任何问题。在归咎于内容之前,先确认那个无视你的引擎到底能不能抓到你。这是技术 GEO 的主题,和“把答案写得更好”是两件不同的调查。

分母问题

Google 排名还能预测“是否被引用”吗?

排名依然是“是否被引用”的最强单一预测因子,且它本身已经不够。但你无法把这句话表达成某一个重合百分比,因为已发表的那些数字回答的是两个不同的问题。「有多大比例的 AI 回答里至少包含一个也有排名的页面?」和「有多大比例的单条引用来自也有排名的页面?」在同一份数据上的答案天差地别。一项 2025 年 10 月覆盖 362,000 条美国查询的商业研究同时报出了这两个数:94% 的 AI Overviews 至少包含一个自然结果前二十的 URL,而单条引用中只有 56% 来自前二十。8 同一份数据,两个数字,都对,相差三十八个百分点。

学术数字一旦读清分母,也落在同一个位置,而且它们合起来是一个带着两个日期的区间,不是一个点值。Kirsten 等的 4,706 条查询审计采集于 2025 年 9 月的美国与德国,按“系统查阅过的域名”计:“平均有 53%(27%)被 AIO 查阅的域名不在自然结果的前十(前一百)之内。”2 Xu、Iqbal 与 Montgomery 在 2026 年 3 月 13 日至 4 月 21 日采集了 55,393 条趋势查询,报告 AI Overview 引述的域名中有 29.8% 在对应的首页上根本不出现。10 正确的做法是把它当作区间引用:大约 30% 到 53%,并写明两个采集时间窗;同时把动词分清楚:Kirsten 测的是系统“查阅过”的域名,这和它“引用”的域名并不是同一回事,而且这两个数字都不是在说“AI Overviews 里通常有没有一个有排名的页面”。通常是有的。

这些数字变动得很快:某个提供方发布过两个按引用计的重合率,2025 年 9 月为 54.5%,2026 年 2 月约为 17%,同一个工具、同样的九个行业,对这个落差没有给出任何解释。9 任何超过约六个月的重合数字都按过期处理,没有日期的则按虚构处理。

本文的诚实边界

这里的每一个重合数字都是一个移动系统的快照,而没有任何一项学术研究覆盖了创业者真正关心的全部引擎。SIGIR 那项比较的是 Google 的三个界面,ACL 那项只做 Google,双助手那项测的是 2024 年时的 Bing Chat 与 Perplexity。至今没有人用同一套方法、在同一个时间窗内测量过 ChatGPT、Perplexity、Google、Copilot 和 Claude 之间的跨引擎重合,所以“引擎之间分歧很大”这个一般性结论有充分支撑,而任何具体的两两数字都不能迁移到你的 prompt 集合上。请测你自己的集合,不要照搬这些数字。

报告方式

为什么单一的综合 AI 可见性分数没有意义?

跨引擎取平均,恰好毁掉了决策所需要的那部分信息,因为两条只有松散相关的序列,其平均值并不构成对任何一条的摘要。一个在某引擎 40% 的运行里被引用、在另一个引擎 0% 的品牌,和一个在两边都是 20% 的品牌,综合分数完全相同,而这两种处境要做的事恰好相反。前者是某一个引擎上的访问问题,后者是“到处都弱但都在”的位置。

加权只会让情况更糟而不是更好,因为跨引擎时“一次引用”不是同一个单位。在那份 602 条 prompt 的数据集里,每个被引页面的平均影响力,ChatGPT 是 0.2713,Google 是 0.0584,Perplexity 是 0.0646,也就是说一次引用能塑造多少答案,差了大约四倍。7 把一次 ChatGPT 引用加上一次 Perplexity 引用,等于把两个不同单位相加,任何单一标量都修不好这一点。

综合数字只有一个很窄的用途:以季度为粒度的粗略趋势线,此时你只关心整体画面在不在动。它撑不起排优先级、竞品比较,也判断不了某个具体改动有没有奏效,而大多数人拿它去做的恰恰是这三件事。

方法

那应该怎么报告 AI 可见性?

一个引擎一个界面一行,行与行之间不做任何算术。用一张表格就能跑。

把引擎和界面写进每一个数字里

不是「AI 可见性 18%」,而是「Google AI Mode,en-US,2026 年 8 月,40 次运行中被引用 7 次」。AI Overviews 和 AI Mode 是不同的界面,必须分行:毕竟同一家公司自己的几个界面之间重合度也只有 Jaccard 0.11–0.18。

记录被引用的 URL,而不只是“你在不在”

每个引擎反复引用的那组来源,就是你在那里的竞争对手地图,而且各引擎不同。在多数商业问题上,这张清单的大部分属于别人。

预期修复会落得不均匀,并且提前说明

一个提高了某引擎引用率的改动,可能在另一个引擎上好几个月毫无动静,甚至永远没有。在发布之前就定好“按引擎的目标”,可以避免这被读成失败。

挑你的买家在用的那一两个引擎

分化意味着“平均覆盖五个引擎”要为同样的置信度付出五倍成本。把两个引擎测扎实,胜过把五个都测得潦草;而选哪两个,应该跟着你的流量已经来自哪里走。

上面这套报告纪律就是全部方法,它不需要任何软件。AI 搜索如何工作这一阶段 提供了解释这种分化的管线阶段;衡量 AI 可见度这一阶段 把按引擎分行的表变成完整的测量计划;姊妹篇《AI 答案为何变化》讲的是每一行内部的运行间波动。

产品在哪里派得上用场,在哪里派不上

上面那张按引擎分行的表,你完全可以手工跑:固定 prompt、每个引擎一个标签页、统计运行次数和被引用的 URL、不做平均。Bavior 自动化的正是这件杂活:它按计划把一组固定的 prompt 打到五个引擎上,记录每条答案引用了哪些来源,按引擎分别报告而不是混合。它不产出单一可见性分数,无法告诉你两个引擎为什么对你的判断不同,也左右不了你的买家在用哪个引擎。免费 AI 可见性检测免费 GEO 体检不需要付费方案;付费追踪为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 29 日)。

出处,全部核查于 2026 年 8 月 30 日
  1. Grossman 等,《How Generative AI Disrupts Search》,SIGIR 2026,11,500 条查询;摘要写的是“平均 Jaccard 相似度小于 0.2”,两两之间的 0.18、0.16、0.11 在表 2 中:arxiv.org/abs/2604.27790
  2. Kirsten 等,Findings of ACL 2026,对 Google AI Overviews 的 4,706 条查询审计,数据采集于 2025 年 9 月,覆盖美国与德国;原文为“on average 53% (27%) of domains that AIO consults are not contained in top-10 (top-100) Organic search results”:aclanthology.org/2026.findings-acl.526
  3. Li 与 Sinnamon,《Generative AI Search Engines as Arbiters of Public Knowledge》,Proceedings of ASIST 61(1),2024;跨 Bing Chat 与 Perplexity 的 672 条回答,355 个唯一域名,26% 被两者共同引用:arxiv.org/abs/2405.14034
  4. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(综述预印本):arxiv.org/abs/2607.14035
  5. 关于“训练令牌与搜索令牌”拆分的第一方爬虫文档:OpenAI developers.openai.com/api/docs/bots,Anthropic support.claude.com/en/articles/8896518,Perplexity docs.perplexity.ai/guides/bots
  6. Google Search Central,《AI features and your website》(查询扇出,第一方文档,最后更新于 2025 年 12 月 10 日):developers.google.com/search/docs/appearance/ai-features
  7. Zhang、He、Yao,《From Citation Selection to Citation Absorption: A Measurement Framework for GEO Across AI Search Platforms》,2026 年 4 月 28 日,arXiv:2604.25707(预印本,602 条 prompt 的开放数据集):arxiv.org/abs/2604.25707
  8. 2025 年 10 月一项 362,000 条美国桌面端查询的研究,同时报出「94% 的 AI Overviews 含一个自然结果前二十的 URL」与「单条引用中 56% 来自前二十」。厂商发布;按本课程出处规则,只描述、不链接。
  9. 某提供方用同一工具、同样九个行业发布的按引用计重合率:2025 年 9 月 54.5%,2026 年 2 月约 17%,两者未作调和。厂商发布;按本课程出处规则,只描述、不链接。
  10. Xu、Iqbal 与 Montgomery,2026;55,393 条趋势查询,采集于 2026 年 3 月 13 日至 4 月 21 日;原文为“29.8% of AIO reference domains do not appear anywhere on the corresponding first page”(预印本):arxiv.org/abs/2605.14021
  11. Schulte 等,2026;在四个引擎、45 天里,按天计的来源层面 Jaccard 约为 0.34 到 0.42,样本为一个很小的瑞士查询集合;按出处 4 的批判性综述转述引用。
常见问题

你想知道的,都在这里。

如果 ChatGPT 引用了我,Perplexity 也会引用我吗?

按现有证据看,通常不会。一项对 Bing Chat 与 Perplexity 共 672 条回答的审计发现 355 个唯一被引域名,其中只有 26% 在两边都出现。哪怕是同一家公司基于同一索引构建的两个界面,URL 层面的 Jaccard 相似度也只有 0.11 到 0.18(SIGIR 2026 上发表的 11,500 条查询研究)。请把某个引擎上的一次引用只当作关于该引擎的证据,其他引擎要分开验证,不要默认它们会跟进。

AI 引用和自然结果前十的真实重合率是多少?

不存在唯一正确的数字,因为已发表的各个数据回答的是两个不同的问题。按“每条 AI 回答”计算,也就是问“这条回答里是否至少有一个页面同时也有排名”,某项 362,000 条查询的商业研究发现 94% 的 AI Overviews 含有一个前二十的 URL。按“每次引用”计算,也就是问“被引用的页面中有多大比例同时也有排名”,同一份样本给出的是前二十占 56%,而一项 4,706 条查询的学术审计在 2025 年 9 月的数据上发现,AI Overviews 查阅的域名中有 53% 不在自然结果前十。2026 年 3、4 月采集的一项 55,393 条查询的预印本,在可比的“首页”口径上测到 29.8%,所以要引用区间而不是点值。在转述任何一个数字之前,先问它用的是哪个分母、哪个采集时间窗。

我应该只针对一个 AI 引擎优化,还是全都做?

挑你的买家真正在用的那一到两个,因为分化会让“全都做”变得昂贵而不是周全。要把五个引擎覆盖到同样的置信度,采样成本大约是五倍;而在一个界面上奏效的修复,在另一个界面上经常毫无作用:同一家公司自己的自然结果、AI Overviews 与 Gemini 三者之间的 Jaccard 只有 0.11 到 0.18。唯一的例外是技术可检索性,它是同时对所有引擎生效的那一层,因为可被索引、够快、服务端渲染在哪里都有帮助。

单一的综合 AI 可见性分数有没有用?

只在作为季度间的粗略趋势线时有一点用,做决策时绝不可用。一个在某引擎 40% 的运行里被引用、在另一个引擎 0% 的品牌,和一个在两边都是 20% 的品牌,综合分数完全相同,但这两种处境需要的工作恰好相反。加权也救不了它:在一份 602 条 prompt 的学术数据集中,每个被引页面的平均影响力,ChatGPT 是 0.2713,Google 是 0.0584,Perplexity 是 0.0646,可见不同引擎上的引用根本不是同一个单位。

为什么某个引擎在 Google 上引用我,ChatGPT 里却从来没有?

最常见的原因是:在做任何排序之前,这两个引擎读到的根本不是同一个版本的网页。每家厂商都在文档里区分了各自的爬虫令牌,OpenAI 把 GPTBot 与 OAI-SearchBot 分开,Anthropic 把 ClaudeBot 与 Claude-SearchBot 分开,Google 把 Google-Extended 与 Googlebot 分开,所以一条 robots.txt 规则、一条 WAF 规则或一个渲染要求,可能把你从某个引擎的候选池里剔除,而另一个引擎毫发无损。在重写页面之前,先按引擎逐个检查可抓取性。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

不存在唯一的 AI 位次。
改成一个引擎一行地报。

免费试用