首页/学习 GEO/什么会被引用
AI 搜索如何工作 · 专题

AI 搜索引擎到底会引用哪些来源:基于 602 条受控 prompt 的测量。

这个问题目前唯一的公开学术分类研究,把 21,143 条 AI 引用按来源类型、按引擎、以及按“每一条实际塑造了多少答案”拆开。第三个维度几乎没人引用。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

在被测的每一个引擎上,论文标为“官方”的来源都是占比最大的单一引用类别:ChatGPT 34.22%,Google 的 AI 界面 46.35%,Perplexity 44.07%;其次是新闻和垂直出版物。在一份覆盖 21,143 条检索层引用与 18,151 个被抓取页面的 602 条 prompt 学术数据集中,这三类合计占全部引用的 79–88%。1

要点速览
  • 撑起这份清单的是官方来源、新闻和垂直出版物。从量级上说,论坛和百科并不是主体。
  • 跨引擎时“一次引用”不是同一个单位:每个被抓取页面的平均影响力,ChatGPT 是 0.2713,另两家是 0.0584 和 0.0646。
  • 被引用最多的类型,不是被吸收最多的类型。在被测的七种域名类型里,新闻媒体的平均影响力垫底,百科类居首。
分类

AI 引擎实际引用的是哪些类型的来源?

AI 引擎引用得最多的来源类型是官方来源,其次是新闻,再次是垂直出版物;在该问题目前唯一的公开学术分类研究中,这三类合计占全部引用的 79–88%。

602 条受控 prompt,21,143 条检索层引用,23,745 条引用级记录,18,151 个被抓取页面,72 个特征。2026 年 4 月以预印本形式发表并附开放数据集。1

按来源类型划分的引用占比ChatGPTGoogle(AIO + Gemini)Perplexity
官方34.22%46.35%44.07%
新闻31.17%18.99%16.07%
垂直 / 细分22.13%22.00%18.99%
以上三类合计87.52%87.34%79.12%
每条回答的平均引用数6.8812.0616.35
每个被抓取页面的平均影响力0.27130.05840.0646

第一行才是能改变创业者周一做什么的那一行。官方来源在 AI 答案里不是边缘类别,而是被测三个平台上占比最大的一类。论文把这一列标为“官方”,但没有给出定义,而它自己的局限部分说这套来源类型分类含有未知和有噪声的取值。“AI 答案主要是论坛加百科”这个被广泛重复的说法,在这份数据里从量级上并不成立;不过某个高流量讨论平台仍然可能在某一个具体问题上占主导。

这张表说明的第二件事是:各引擎的“食谱”截然不同。新闻类占 ChatGPT 引用的 31.17%,占 Perplexity 的 16.07%,在同一个测量窗口内差了近两倍。如果你所在的品类被行业媒体大量报道,那么在你写下一个字之前,某个引擎在结构上就已经比另一个更友好。

单位

一条答案会引用多少来源,这重要吗?

这个数量在不同引擎之间差了两倍以上:ChatGPT 每条回答 6.88 条引用,Google 的 AI 界面 12.06,Perplexity 16.35。而“数量”是这个发现里较不重要的那一半。1 更重要的一半是每个被抓取页面的平均影响力:ChatGPT 0.2713,Google 0.0584,Perplexity 0.0646,单个来源占成品答案的比重大约相差四倍。

因此跨引擎时“一次引用”不是一个等值单位,任何把不同引擎的引用次数加总成一个数的报告,都是在把含义不同的量相加。在一个“重度倚赖每个来源”的引擎上成为七分之一,和在一个“广而浅地采样”的引擎上成为十六分之一,是实质不同的结果。设目标时请按引擎设,并说清你瞄准的是这两种结果中的哪一种。

这也重新定义了“引用数少”意味着什么。引用来源更少的引擎不是吝啬,而是在集中,这让它对品牌来说方差更大:你要么实质性地在答案里面,要么完全不在。广采样引擎给的则是更频繁、更薄的露出,二者没有普遍意义上的优劣。

选择与吸收

“被引用”和“塑造了答案”有什么区别?

被引用,是指答案上挂了一个指向你页面的链接;塑造了答案,是指答案的文字确实来自你的页面。2026 年 4 月那篇预印本把这两者分成了两个被分别测量的阶段,称为“引用选择”与“引用吸收”。1 一个页面可以被抓取、被列进来源清单,却几乎没有贡献读者读到的任何内容。第二阶段的指标就是“每个被抓取页面的影响力”,而它才是与商业价值同向变动的那个。

在这两者之下还有第三个、更弱的结果:作为一个链接出现,而答案正文从未提到你的名字。2026 年 6 月发表的一项小型多平台研究,覆盖 115 条 prompt、3,981 次域名出现、四个平台、十四个国家,把约 62% 的来源出现归为“答案正文从未提及其品牌名”。2 样本很薄,这个数字应按方向性结论对待;但它命名的这个区分值得分开追踪:正文点名、仅挂链接、完全缺席。

把这三种结果分开追踪,关于 AI 可见性的大部分困惑就消散了。「我们被引用了但没人点」通常是“仅挂链接”的结果;「我们被提到了但没有链接」是另一个问题,解法也不同。一个把三者压成一个“出现率”的报告,无法告诉你你处在哪一种。

按类型看影响力

哪些来源类型真的在塑造答案,而不只是出现在里面?

不是被引用得最多的那些。改用平均影响力而不是占比来打分,排序就反过来了:百科类来源居首,新闻媒体在被报告的七种域名类型中垫底。

同一份数据集不仅按引擎,也按域名类型给出了每个被抓取页面的平均影响力,而这个排序和上面那张占比表并不一致:百科类来源平均 0.2144,商业类 0.1028,新闻媒体在 1,546 条引用上只有 0.0726,是被报告的七种类型中最低的。1 新闻占了 ChatGPT 引用的 31.17%,却在“占成品答案多少”上接近垫底;作者的解读是,引擎在由时效性来源弄清“发生了什么”之后,会转而去找解释性的页面。

对同一批记录的第二种切法,打分的是一个段落所承担的角色,而不是它所在网站的种类。定义类段落平均 0.1531,对比类 0.1524;作为背景的段落是 0.0801,而“仅作参考”的引用只有 0.0529,大约是定义类的三分之一。一个页面在答案里“派什么用场”,比它属于哪一类网站更重要;一个提供了干净定义或同口径对比的商业页面,做的正是百科通常在做的事。

相关因素

哪些页面特征与更高的引用影响力同时出现?

在所有被测的页面特征里,与引用影响力关联最强的是“与查询的相关性”,r = 0.4322,高于数字、定义、标题数量和列表密度。

下面这张网格是来自同一数据集的描述性关联,最高四分位对最低四分位。作者把验证性分析留给后续工作,也无法区分因果与相关。1

+61.6%

含有数字的页面

带统计数字的页面平均影响力为 0.1171,不带的为 0.0725。2026 年的批判性综述附了一个具有约束力的条件:标准不是“加数字”,而是提供相关的、可验证的、有日期的、且正确归因的证据。3

+57.3%

含有定义标记的页面

平均影响力 0.1252 对 0.0795。在这份数据集里,定义标记是 Google 最强的分平台信号之一,与“答案与引用”嵌入相似度并列。

r = 0.43

相关性,最强的相关因素

机器判定的查询相关性与影响力的跨平台相关系数为 r = 0.4322,高于“答案与引用”嵌入相似度的 0.3561 和内容质量的 0.2917。相关性胜过所有被测的格式特征。

12.5×

标题数量

影响力最高四分位的页面平均有 10.59 个标题,最低四分位为 0.85;列表密度高出 8.94 倍。作者明确表示,他们无法判断是标题导致了吸收,还是好页面本来就标题更多。

−5.7%

问答式页面格式

问答式排版与略低的影响力相关,0.0947 对 0.1005。作者认为这可能是与低质量 FAQ 页面的混淆,而不是反对“把内容写成问题形状”的证据。

长度,证据相互冲突之处

这份数据集发现影响力随长度上升,超过 3,000 词仍在升。而 2025 年 12 月另一项覆盖 174,048 个被引页面的商业研究发现,词数与引用位次的 Spearman 相关只有 0.04,且 53.4% 的引用落在 1,000 词以下的页面上。4 二者结果变量不同;请把长度当作中性。

请按数字给出的顺序来读这组卡片,而不是按讨好内容计划的顺序。相关性是这里最强的相关因素,而 2026 年的批判性综述把“查询与文档的相关性”评为“在受控设定下强”,是它那张支撑度表里仅有的两个达到该级别的杠杆之一。3 其次是可验证的数字与平铺直叙的定义,并附上综述的警告:加入一个捏造的统计数字可能提高被复用率,同时降低认识论质量。标题和列表排在最后,属于相关性证据,值得加是因为它们让页面更好用。而目前对“刻意去推动这些特征”最强的公开检验发现:在 54 个案例中,只有三个出现了统计显著的排名提升。11

本文的诚实边界

上面这张网格里的每一个数字都来自同一篇预印本,作者本人称其为描述性统计,并明确把验证性分析留给后续工作;它是三个平台上的单一采样窗口,上面没有任何一条关联是因果主张。来源类型的占比也高度依赖 prompt 构成:602 条受控 prompt 并不是你的买家所问问题的样本,一个被论坛讨论主导的品类看起来会和这张表完全不同。请用它的形状和排序,不要用它的小数位,并在你自己的 prompt 集合上重新测一遍。后文的另一个数字需要单独加注:27.1% 抓不到的那个数字,测的是“第三方研究者能不能抓到这个被引用的 URL”,不是“引用它的那个引擎能不能抓到”。

归属

一条 AI 答案里,你现实中能拥有多少?

在多数商业问题上只是其中一小部分,即便官方来源整体上是最大的单一类别。34–46% 的官方来源份额,是分摊给答案里所有品牌的,包括你的竞品;清单的其余部分是新闻、垂直出版物和讨论帖,你都控制不了。一项对 Google AI Overviews 的 4,706 条查询学术审计(数据采集于 2025 年 9 月,覆盖美国与德国)发现,它查阅过的域名中 53% 不在自然结果前十、27% 不在前一百。5 一项 55,393 条查询、采集于 2026 年 3 月 13 日至 4 月 21 日的预印本,把可比的“首页”缺口测为 29.8%;所以站得住脚的说法是一个区间,大约 30% 到 53%,并写明两个采集时间窗,而不是从任一项研究里取一个点值。8 一项 11,500 条查询的 SIGIR 2026 研究从另一个角度说明了同一件事:对同一条查询,Google 自然结果、AI Overviews 与 Gemini 各自返回的来源,平均 Jaccard 相似度不到 0.2。10 另外,Kirsten 统计的是 AI Overviews “查阅过”的域名,这和它“引用”的域名不是同一回事。

由此得出两个实际结论。第一,值得写的页面,是那些能凭自身条件被选中的页面:真正回答了某个子问题的文档、把价格写成文字的定价页、诚实到可以被引用的对比页。关于“什么才让一个页面具备资格”,Google 自己的文档说得很直白:它必须被索引、并有资格在搜索里带摘要展示,而且不需要添加任何特殊的结构化数据。6 它另一份优化指南还补充说,这些功能“植根于我们核心的搜索排序与质量系统”。9

第二,“能被抓到”是前提,不是细节。2026 年一篇预印本(经那篇批判性综述转述)发现,AI 答案中已经被引用过的 URL 里有 27.1% 抓不下来,原因是不可访问、已删除或非文本;而在成功抓取到的 19,154 个文本页面中,约 16% 被作者的检测器标记为 AI 生成。7 一个躲在登录墙、插页广告或反爬网关后面的页面,无论写得多好都出局了,这是技术 GEO 的主题。

产品在哪里派得上用场,在哪里派不上

这里的整套方法都能从下面链接的论文里读到,而它的实操版本就是一张表格:跑你的 prompt,把被引用的 URL 抄下来,逐条标记为官方、新闻、垂直或讨论,然后计数。Bavior 替你做的是这个收集步骤,按计划跨五个引擎运行,记录每条答案引用了哪些来源,于是你自己那些问题的来源构成是“看得见的”,而不是从别人的 602 条 prompt 里推断出来的。它不测量每页影响力(那需要把答案文本和来源文本对齐),也不对“能否把你的页面送进那份清单”作出任何承诺。免费 AI 可见性检测免费 GEO 体检不需要付费方案;付费追踪为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 30 日)。

出处,全部核查于 2026 年 8 月 30 日
  1. Zhang、He、Yao,《From Citation Selection to Citation Absorption: A Measurement Framework for Generative Engine Optimization Across AI Search Platforms》,2026 年 4 月 28 日,arXiv:2604.25707(预印本,开放数据集;仅描述性统计):arxiv.org/abs/2604.25707
  2. 2026 年 6 月一项多平台研究,115 条 prompt、3,981 次域名出现、四个平台、十四个国家;约 62% 的来源出现属于“答案正文从未提到其品牌名”。样本较小。厂商发布;按本课程的出处规则,只描述、不链接。
  3. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(综述预印本;表 4 把“查询与文档的相关性”评为“在受控设定下强”):arxiv.org/abs/2607.14035
  4. 2025 年 12 月一项研究,560,346 条 AI Overviews,解析出 174,048 个可提取内容的页面;词数与引用位次的 Spearman 相关为 0.04,53.4% 的引用落在 1,000 词以下的页面。厂商发布;按本课程的出处规则,只描述、不链接。
  5. Kirsten 等,《Characterizing Web Search in The Age of Generative AI》,Findings of ACL 2026,4,706 条查询审计,数据采集于 2025 年 9 月,覆盖美国与德国;原文为“on average 53% (27%) of domains that AIO consults are not contained in top-10 (top-100) Organic search results”:aclanthology.org/2026.findings-acl.526
  6. Google Search Central,《AI features and your website》,最后更新于 2025 年 12 月 10 日(索引与摘要资格;原文为“no special schema.org structured data that you need to add”):developers.google.com/search/docs/appearance/ai-features
  7. Allaham 与 Diakopoulos,2026 预印本(见于 arXiv:2607.14035 第 8.3 节):AI 答案中已被引用的 URL 有 27.1% 研究者无法抓取;在成功抓取的 19,154 个文本页面中约 16% 被标记为 AI 生成
  8. Xu、Iqbal 与 Montgomery,《Measuring Google AI Overviews》,2026;55,393 条趋势查询,采集于 2026 年 3 月 13 日至 4 月 21 日;原文为“29.8% of AIO reference domains do not appear anywhere on the corresponding first page”(预印本):arxiv.org/abs/2605.14021
  9. Google Search Central,《Google’s Guide to Optimizing for Generative AI Features on Google Search》,最后更新于 2026 年 7 月 10 日:原文为“our generative AI features on Google Search are rooted in our core Search ranking and quality systems”:developers.google.com/search/docs/fundamentals/ai-optimization-guide
  10. Grossman 等,《How Generative AI Disrupts Search》,ACM SIGIR 2026,arXiv:2604.27790;11,500 条查询的基准集;被检索到的来源“substantially different for each search engine (<0.2 average Jaccard similarity)”:arxiv.org/abs/2604.27790
  11. Puerto、Gubri、Green、Oh、Yun,《C-SEO Bench: Does Conversational SEO Work?》,NeurIPS Datasets & Benchmarks 2025,arXiv:2506.11097 第 6.2 节:原文为“Out of 54 cases, we uncover only three where the ranking improvements are statistically significant”:arxiv.org/abs/2506.11097
常见问题

你想知道的,都在这里。

AI 答案是不是主要引用论坛和维基百科?

就该问题目前唯一的公开学术分类研究看,从量级上说不是。在一份覆盖 21,143 条检索层引用的 602 条 prompt 数据集中,官方来源在每一个被测平台上都是占比最大的单一类别:ChatGPT 34.22%,Google 的 AI 界面 46.35%,Perplexity 44.07%,其余大部分是新闻和垂直出版物。某个讨论平台仍然可能在某一个具体问题上占主导,所以“形状”比“小数位”更耐用。

一次 AI 引用在每个引擎上的价值一样吗?

不一样,差距大约是四倍。在一份 602 条 prompt 的学术数据集中,每个被抓取页面的平均影响力:ChatGPT 0.2713,Google 的 AI 界面 0.0584,Perplexity 0.0646;而每条回答的平均引用数分别是 6.88、12.06、16.35。引用来源更少的引擎,对每一个来源的倚重更重。因此把不同引擎的引用次数加总成一个数,是在把含义不同的量相加。

到底哪些来源类型最能塑造答案?

不是被引用得最多的那些。在同一份数据集中按“每个被抓取页面的平均影响力”打分,百科类来源平均 0.2144,新闻媒体 0.0726,在被报告的七种域名类型中垫底,尽管新闻占了 ChatGPT 引用的 31.17%。若按段落承担的角色打分,定义类平均 0.1531,对比类 0.1524,而“仅作参考”的引用只有 0.0529。

我应该加更多小标题和列表来提高被引用率吗?

加,是因为它们让页面更好用;不要为引用许下任何承诺。这个关联确实存在且很大:影响力最高四分位的页面平均有 10.59 个标题,最低四分位只有 0.85。但该数据集的作者直接说明,他们无法区分“标题导致了吸收”还是“好页面本来就标题更多”。2026 年的批判性综述把文档结构评为“中等且异质”。

“引用选择”和“引用吸收”有什么区别?

引用选择指的是“答案有没有挂上指向你页面的链接”;引用吸收指的是“答案的正文有多少实际来自你的页面”。提出这个区分的 2026 年 4 月预印本,用“每个被抓取页面的平均影响力”来度量后者,而这两者经常脱节:一个页面可以被抓取、被列为来源,却几乎没有贡献读者看到的任何内容。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

来源构成可以靠猜。
但用你自己的 prompt 去测,不能省。

免费试用