首页/学习 GEO/答案里有多少属于你
站外 GEO · 先把问题量出来

一条 AI 答案里,究竟有多少属于你?

在判断站外工作值不值得做之前,先把“站内工作永远够不到的那部分”量出来。已发表的平均数不是你的份额,而两者之间的那道算术,正是 GEO 方案出错的地方。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

在典型的商业问题上只占少数,而且值得据以做计划的那个数,是你在自己的 prompt 集上测出来的,不是从某项研究里读来的。你今天就能改动的页面只是三桶里的一桶,旁边还有“讲你的第三方页面”和“跟你毫无关系的页面”。唯一一份公开的 AI 引用学术分类里,最大的单一类别标签是 Official,在 ChatGPT 上占引用的 34.22%、在 Google 的 AI 界面上占 46.35%、在 Perplexity 上占 44.07%;这意味着在每一个被测引擎上,大多数引用都不是官方来源,而且这个官方份额覆盖的是答案里提到的每一个主体,而不只是你。1

关键要点
  • “最大的单一类别”和“答案的大部分”是两个不同的说法。Official 在被测的三个引擎上都居首,却最高只到 46.35%,所以有 54% 到 66% 的引用是别的东西。
  • 这个类别是共享的。在那份数据集里,一条 Google AI 答案平均引用 12.06 个来源,而官方那一片是分给答案里提到的每一个厂商、机构和标准组织的,所以单个品牌分到的是“分数的分数”。
  • 你真正够得到的份额还要更小,因为一个自有页面必须先能被抓取、并且与某条子查询相关,它的文字才开始起作用。
  • 用你自己的引用日志去测这个数。在 95% 置信度下,大约需要 200 条记录在案的答案,七个百分点的变化才能与噪声区分开。
定义

什么才算“你拥有的页面”?

这里的“拥有”需要一个狭窄的操作性定义:一个被引用的 URL,位于一个你今天不用问任何人就能改动其文字的域名上。按这个定义,答案里的每一条引用都会落进三桶之一。自有是你的站点、你的文档、你的更新日志、你的价格页。可影响是那些提到你、而你只能通过给别人一个修改的理由才能推动的第三方页面:合辑、评测目录、社区讨论帖、新闻报道。都不是是剩下的那些,在多数问题上它们才是答案的主体,因为一个问题通常需要一批跟你的品类毫无关系的来源。

这个拆分里有两样东西经常被算错。一个位于“你租而不是你有”的域名上的页面,比如市场平台的商品页或别人平台上的主页,其行为更像可影响页面:运营方可以在不通知你的情况下改模板、改 canonical、改 robots 规则。另外,没有附链接的品牌提及根本不是引用。那是另一个量,受另一套原因驱动,六个都叫可见性的东西把它们区分开了;这个区别在这里很重要,因为“引用中的自有份额”和“行文中的自有份额”是两个不同的数字,修法也不同。

分母

为什么最大的引用类别不等于你的份额?

类别份额和品牌份额的分母不一样,而没人当众做过两者之间的那道除法。

先从表本身说起。2026 年 4 月一篇附带公开数据集的预印本,在 ChatGPT、Google AI Overview 与 Gemini、Perplexity 上分析了 602 条受控 prompt、21,143 条搜索层引用和 18,151 个成功抓取的页面。它的来源类型构成是:ChatGPT 上 Official 34.22%、News 31.17%、Vertical 22.13%;Google 上 Official 46.35%;Perplexity 上 Official 44.07%。1 在三个平台上,Official 都是最大的单一类别。它在三个平台上同时也是整体中的少数,因为哪怕取最高那个值,也仍有 53.65% 的引用去了非官方的地方。

这两半必须一起说,因为单说任何一半都指向错误的方向。只引前一半,你会得出“AI 答案主要是品牌站点、你自己写的东西决定结果”的结论。只引后一半,你会得出“官方来源基本不出现”的结论,而同一张表就否掉了它。经得起推敲的读法更窄也更有用:官方来源是进入一条答案最强的单一入口,同时它把答案的大部分留给了别人。

接着做除法。同一份数据集给出的每条回答平均引用数是:ChatGPT 6.88、Google 12.06、Perplexity 16.35,中位数分别为 6、12、17。1 套上官方份额,一条中位数的 Google 答案大约带着五到六条官方站点引用,而它们分散在这个问题需要的那些厂商与机构之间。在一个点名六款产品的候选清单类问题上,你的站点最多是六分之一。单个品牌的诚实预期,是一条答案里个位数的低百分比,而不是三分之一。

请按印出来的标签去读。那一列就叫 Official,论文没有给出定义;它的外部效度小节也写明来源类型分类中含有未知与噪声值。1 请把排序当作信息,把小数点后的位数当作不是。哪些来源会被引用把这套分类的其余部分走了一遍。

够得到多少

站内工作到底能够到答案的多少?

只有自有那一桶,而且只有其中在当下这个问题上被检索到的那部分。两项审计量出了排名与检索之间的差距。发表于 Findings of ACL 2026 的一项 4,706 条查询的 Google AI Overviews 审计,数据采集于 2025 年 9 月的美国与德国,原文写道:“on average 53% (27%) of domains that AIO consults are not contained in top-10 (top-100) Organic search results”。2 另一项 55,393 条查询、采集于 2026 年 3 月 13 日至 4 月 21 日的预印本发现,AI Overview 引述的域名中有 29.8% 不出现在对应的首页上。3 两者的动词不同,一个数的是“查阅过”的域名,另一个数的是“引述过”的域名,所以请把两个采集窗口都写出来,而不是从任一项里取一个点值。

这对一个自有页面来说是双向的。一个在可见问题上毫无排名的页面,仍可能因为其中某条子问题被检索到,这正是一个文档页能进入其首页永远够不到的答案的原因。这也意味着,你的排名对“答案”的杠杆比对下面那十条蓝链要弱,哪怕 Google 表示其“在 Google 搜索上的生成式 AI 功能根植于我们核心的搜索排序与质量系统”(该页更新于 2026 年 7 月 10 日)。8 可检索性挡在这一切前面:一个抓不到的自有页面根本不在候选里,写了什么都一样。这是可检索性天花板的主题,修复顺序在技术清单里。

自有这一桶里到底有多少可动的空间,被测过两次,两次的答案都不大。C-SEO Bench 是 NeurIPS 2025 的一项基准测试,覆盖十种方法、六个领域、逾 1.9k 条查询和 16k 份文档,发现在零售领域里最好的内容方法平均把引用排名提升 0.36 位,而把来源移到上下文第一位是 2.77 位,并且原文写道“out of 54 cases, we uncover only three where the ranking improvements are statistically significant”。4 KDD 2026 上一项覆盖十种策略的竞技场研究发现,只改正文这一种做法在其三项可见性指标上得分为 0.53、0.84、0.47,而基线是 0.58、1.00、0.50,也就是比什么都不改分别低 9%、16%、6%。5

方法

怎样测出你自己的自有份额?

用你自己的引用日志去数,因为每一个已发表的平均数,平均的都是一套不属于你的查询组合。做法就是一张表。按计划跑一组固定的 prompt;对每一条答案,记录每一个被引用的 URL,而不只是属于你的那些;再按上面的定义把每个 URL 标成自有、可影响或都不是。然后算两个数,并且把它们分开。自有引用份额是自有 URL 除以整个答案集里的全部被引 URL,它说明你供给了答案的多少。自有答案覆盖率是“至少含一个自有 URL 的答案”所占比例,它说明你到底多常出现。后者总是更大的那个,而用其中一个的名字去报另一个的值,是这项测量最常见的注水方式。

把所有人的 URL 都记下来,才让这个数字真正有用,因为同一份日志同时也是“当下正在决定你这个品类的第三方页面”清单,而这正是本阶段其余部分要动的东西。要记录的十个字段给出了记录结构。人们会跳过的那个字段是“完整的被引 URL”而不是域名,而一个过期的对比页和一个公司首页不是同一个问题。

有一支团队每周跑四十条 prompt,却只记录“自己的域名有没有出现”,于是花了一个季度报告一条平线。把同一段时间用“记录每一个被引 URL”的方式重跑一遍,才看出那条平线是两个反向运动叠出来的:自有份额从一个很小的基数上大约翻了一倍,而某个在约三分之一答案里被引用的评测合辑,还挂着他们几个月前就不再收的价格。那个季度真正该做的动作是给一位评测作者发一封邮件,而在自己站点上做多少功夫都不会把它翻出来。

精度

要多少条答案,这个份额才有意义?

自有引用份额是一个比例,所以它的不确定性只取决于样本量,别无其他。本站引用的是 95% Wilson 区间,其在最坏情况 p = 0.5 下的半宽等于 1.96 除以 2 乘以根号(n 加 3.84)。5 条答案大约是正负 33 个百分点,30 条是正负 17,200 条是正负 7。一个在 30 条答案上从 4% 走到 6% 的自有份额并没有动,无论那一列相对变化写了什么。统计功效把这道算术完整走了一遍。

另外两个来源的波动跟你毫无关系。2026 年那篇批判性综述转述的一项研究发现,在温度为零的条件下重复跑同一条 prompt,会有 9% 到 28% 的判定发生变化,也就是说把采样旋钮关到底,跑与跑之间的方差依然存在。6 同一篇综述转述的另一项研究,在四个引擎上跟踪 45 天,测得逐日的来源层 Jaccard 相似度在 0.34 到 0.42 之间,意味着被引来源中有很大一部分每天都在换;它跑在一个规模很小的瑞士查询集合上,所以请读方向而不是系数。6

由此得到的是一套报告节奏,而不是一块看板。固定 prompt 集,固定运行次数,把区间印在点估计旁边,并且按季度而不是按周去比。一个这么小又这么吵的数字仍然值得拥有,因为它的职责是给“力气往哪儿花”这个决定定尺寸。

后果

这个拆分会改变“下一个小时花在哪”吗?

它改变的是每一类小时的天花板,而不是它们各自的价值。站内工作作用于自有那一桶,其实测效应量不大,其检索前提近乎二元。站外工作作用于可影响那一桶,而一条商业答案里的大多数引用就住在那里,也正是你在自己域名上发布的任何东西都够不到的地方。由此得出的顺序并不体面:先让自有页面能被抓取,因为那里的一个零会把下游全部抵消;再去弄清你实际的自有份额是多少;然后把剩下的小时花在你自己的日志说“正在决定答案”的那些第三方页面上。

这项测量有两样东西它不是。它不是营收数字:2026 年那篇批判性综述把“引用得分能预测点击、转化或营收”的证据评为极低6;而 Pew 覆盖 900 名美国成年人、68,879 次搜索、数据采集于 2025 年 3 月的行为面板发现,点击 AI 摘要内部的来源“只发生在 1% 的访问中”。7 它也不是排名。这一切唯一站得住脚的结果语言,是提及份额、引用份额和声量份额,并且每一个都要标注具体引擎、具体 prompt 集和日期。

“把自有份额做高”并不自动就是目标。在一个诚实答案本该是“五家厂商的横向比较”的问题上,一条主要由某一家自己的页面拼出来的答案会更差,而且没有哪个引擎会去拼它。经得起证据检验的目标是:引擎实际用到的那些来源,把你描述对了。这正是本阶段其余部分要讲的,从站外阶段本身开始。

本文的诚实边界

34.22% 到 46.35% 这组数字出自单独一篇预印本,它的 602 条 prompt 是设计出来的而不是从真实用户行为里抽样的,它的 Official 一列从未被定义,而它自己的外部效度小节写明来源类型分类含有未知与噪声值。更要紧的是,没有任何已发表的研究报告过“自有引用份额”在各个品牌间的分布。本文的算术是拿一个类别平均数去除以一个引用条数,而不是直接测量按品牌的份额,所以它给出的是一个数量级而不是一个值,各品牌与各品类之间的离散程度仍然未知。扎实的部分是那两项检索差距审计,它们样本大,其中一项经过同行评议;以及“去测你自己的份额”这条指令,它不依赖上面这些数字对不对。

产品在哪里派得上用场,在哪里派不上

上面的一切就是一份固定 prompt 清单加一张表,不花钱。Bavior 不会提高你的自有份额,不替你写或改你域名上的页面,不爬你的站点,也没法把一个抓不到的页面变得能抓;你日志里的那些第三方页面同样不是我们能改的。它做的是采集这一步:按计划把一组固定的 prompt 打到五个引擎上,记录每一个被引用的 URL,你的和所有人的,从而把自有份额从一种印象变成一个数字。当被引用的来源是一条活跃的讨论帖时,它会用你掌控的账号起草回复,在任何内容发出之前由你审批。结果按每个引擎的提及份额、引用份额和声量份额来报告,绝不报成名次。免费 AI 可见性检测免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 30 日)。

出处,全部核查于 2026 年 8 月 30 日
  1. Zhang、He、Yao,《From Citation Selection to Citation Absorption》,2026 年 4 月 28 日,arXiv:2604.25707(预印本,附公开数据集);来源类型表与每条回答引用数表,以及 §10.2 的“The source-type taxonomy contains unknown and noisy values”:arxiv.org/abs/2604.25707
  2. Kirsten 等,《Characterizing Web Search in The Age of Generative AI》,Findings of ACL 2026;4,706 条查询,数据采集于 2025 年 9 月,覆盖美国与德国;原文为“on average 53% (27%) of domains that AIO consults are not contained in top-10 (top-100) Organic search results”:aclanthology.org/2026.findings-acl.526
  3. Xu、Iqbal 与 Montgomery,《Measuring Google AI Overviews》,2026(预印本);55,393 条趋势查询,采集于 2026 年 3 月 13 日至 4 月 21 日;原文为“29.8% of AIO reference domains do not appear anywhere on the corresponding first page”:arxiv.org/abs/2605.14021
  4. Puerto 等,《C-SEO Bench: Does Conversational SEO Work?》,NeurIPS 2025 数据集与基准赛道,arXiv:2506.11097;表 3 零售部分与 §6.2:arxiv.org/abs/2506.11097
  5. Kim 等,《SAGEO Arena》,KDD 2026,arXiv:2602.12187;表 2 的“Body Text only”一行:arxiv.org/abs/2602.12187
  6. 《A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(综述预印本);表 5、温度为零下的判定翻转区间,以及它转述的 45 天 Jaccard 跟踪研究:arxiv.org/abs/2607.14035
  7. Pew Research Center,2025 年 7 月 22 日;900 名美国成年人、68,879 次搜索,数据采集于 2025 年 3 月;原文为点击 AI 摘要内部的链接“occurred in just 1% of all visits”:pewresearch.org
  8. Google Search Central,《Google’s Guide to Optimizing for Generative AI Features on Google Search》,更新于 2026 年 7 月 10 日(第一方文档);“rooted in our core Search ranking and quality systems”:developers.google.com/search/docs/fundamentals/ai-optimization-guide
常见问题

你想知道的,都在这里。

一条 AI 答案里,有多少比例来自品牌自己能控制的页面?

在多数商业问题上是个位数的低百分比,不过没有研究按品牌逐一测过。唯一一份公开的学术分类中最大的来源类别标签是 Official,占引用的 34.22% 到 46.35%(取决于引擎),但它涵盖答案里提到的每一个机构。用一条答案通常引用的 6 到 17 个来源去除,单个品牌分到的份额就很小了。请测你自己的那个数,而不是照搬这一个。

“官方来源是最大类别”是不是意味着 AI 答案主要由品牌自己的站点构成?

不是,而且只说这半句会误导人。在被测的三个引擎上,Official 都是最大的单一类别,但它最高也只到 46.35%,所以有 54% 到 66% 的引用来自新闻、垂直媒体、讨论帖或别的东西。这两个事实出自同一张表。有用的读法是:官方来源是进入一条答案最强的单一入口,同时把答案的大部分留给了别人。

我要记录多少条答案,自有份额这个数才有意义?

如果你想看出七个百分点的变化,大约需要 200 条。自有引用份额是一个比例,95% Wilson 区间在最坏情况下等于 1.96 除以 2 乘以根号(n 加 3.84):5 条答案约为正负 33 个百分点,30 条是 17,200 条是 7。引擎自身的波动还要叠加上去,所以请按季度比较,而不是按周。

如果答案的大部分都是别人的页面,站内的功夫还值得做吗?

值得,但预期回报比多数方案假设的要小。站内工作是唯一能推动“自有”那一桶的东西,而可抓取、可匹配是其余一切的前提。它做不到的是覆盖一条商业答案里的大多数引用。请先修可检索性,因为那里是零会把后面全部抵消掉,然后把站外工作当成处理另一桶的那部分。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

答案的大部分属于别人。
先弄清有多少属于你。

免费试用