首页/学习 GEO/六个量
衡量 AI 可见度 · 定义

人们口中的“AI 可见性”,到底是哪六样东西?

六种彼此独立的测量共用一个名字,它们各自变动,而大多数报告只显示其中两个。提及与引用之间的落差,才是会改变你周一做什么的那一个。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

“AI 可见性”是六种不同的测量顶着同一个标签:提及率、引用率、声量份额、答案内位置、表述准确度、来源归属。它们各自变动,所以一个把六者混成一个的可见性总分,恰好把你唯一能据以行动的东西平均掉了。它们会分开,是可以量出来的:一项针对生成式搜索引擎的评测发现,答案中平均只有 51.5% 的句子被其所挂的引用完全支撑,7 可见“被引用”和“被正确描述”显然不是同一个量。

关键要点
  • 这六个不是同一个数字的六种变体。提及率和引用率是占答案的比例,声量份额是品牌之间的比值,位置是序数,表述准确度是人工判定,而来源归属是一份 URL 清单、不是一个分数。
  • 提及对引用,是那道会改变你做什么的缝。有链接却正文不点名,是你自己页面上的造句问题;被点名却没有链接,来自训练数据,站内工作在一个发布周期内动不了它。
  • 来源归属是六者中唯一能指出行动的,因为它记录一条答案引用过的每一个竞品与第三方 URL,而不只是你的。六个量都按引擎索引,所以五个引擎就是三十个数字。
定义

被叫做 AI 可见性的是哪六个量?

有六个彼此独立的量顶着“AI 可见性”这个名字流传,而一份典型的仪表盘会报其中两个。下面每条定义都可以独立成立,因为这六个在日常对话里被互相替换的频率高得惊人。

01

提及率

提及率是“答案正文里点到你品牌名”的答案占比,不论有没有挂链接。它是读者真正体验到的那个量,因为多数读者从不点击来源。

02

引用率

引用率是“把你的某个 URL 作为来源挂上去”的答案占比,不论正文有没有点名。它是六者中唯一能被你的服务器日志部分佐证的量。

03

声量份额

声量份额是你的提及数除以同一答案集合中所有品牌的提及数。它是一个比值,所以竞品一动它就动,哪怕你这边什么都没变。

04

答案内位置

答案内位置是你出现在回答的哪一处。这个领域的开山学术指标,用一个随位置指数衰减的函数来给归因文本加权。1

05

表述准确度

表述准确度是关于你的那句话是否属实。它是六者中唯一可以为负的量:一句自信而错误的描述,在另外五项上都算“出现了”。

06

来源归属

来源归属是一条答案引用过的全部 URL 清单,包括所有竞品的和所有第三方的。它是六者中唯一能告诉你“接下来做什么”的量。

有两个性质让这六者不可互换,而且两者都有据可查,不是断言。第一,它们回答的是关于管线不同阶段的不同问题:2026 年那篇关于生成式引擎优化的批判性综述,最后落在这样一句指令上:“做出一个相关、完整、可核验、结构清晰、且技术上可检索的页面;然后分别测量检索、引用与保真度。”2 检索、引用、保真度在那句话里是三种测量,不是一种。

第二,这六个量每一个都是按引擎索引的。SIGIR 2026 上一项 11,500 条查询的研究测得,Google 自然结果、AI Overviews 与 Gemini 之间 URL 层的 Jaccard 相似度为 0.11–0.18,而这是同一家公司在同一套索引上建的三个界面。3 六个量乘以五个引擎是三十个数字,不是一个;而这些数字该以什么形态汇报,写在衡量 AI 可见度这一阶段 里。

最要紧的那道缝

提及率和引用率为什么会分化?

提及和引用出自系统的两个不同半边,所以两者之间落差的方向是一个诊断,而不是一件趣闻。引用产生于“一份被检索到的文档被挂到某个句子上”;提及产生于“模型把你的名字写进了正文”。两个决定,位置不同,输入不同。

有链接却不点名,意味着检索成功、识别失败。你的页面被抓取了、被判定相关了、被挂上去了,然后引擎用的那个段落没说清楚“是谁在说”。这是整个领域里最容易修的失败,因为它是你自己页面上的一个造句问题:被引用的段落写的是“这个工具每月 99 美元”,而它本该写“Bavior 每月 99 美元”。请把主语放进承载事实的那一句里,而不是放在两段之上。

被点名却没有链接,意味着模型调用的是训练数据,而不是它刚检索到的东西。这是个慢得多的问题。那段描述来自模型训练所用的语料,你无法检视、无法编辑,也不能指望它在一个发布周期内改变。站内工作动不了它;能慢慢动它的,是第三方怎么写你,那是站外 GEO这一阶段 的主题。

这道缝并不小。2026 年 6 月发布的一项厂商研究,覆盖 115 条 prompt、3,981 次域名出现、四个助手、十四个国家,报告约 62% 的来源出现属于“答案正文从未提到其品牌名”的链接,并发现这个比例在引擎之间是反过来的:一个助手在 83.7% 的答案里点名品牌,却只在 21.4% 里引用;另一个点名 20.7%,引用 87%。4 请把这些百分比当作方向性的:115 条 prompt 的样本撑不起两位小数,也没有任何学术复现。站得住的是那个定性结论:这两个比率不是彼此的替代指标,在某些引擎上几乎是反的。

分母

声量份额到底取决于什么?

声量份额完全取决于一个由你选定的分母,这让它成为六者中最容易“不干活也能动”的一个。往统计集合里加两个小竞品,你的份额就掉;把它们去掉,份额就涨。这两种变动都不是关于引擎的事实。修法是流程性的而非统计性的:在报告里写明竞品集合,本季度冻结它,并把版本号记在每个数字旁边,这样两份报告之间才谈得上可比。

还有第二个分母问题,它专属于基于引用的声量份额,而且不是靠纪律能解决的。不同引擎给一条答案挂的来源数量不同。在一项收集了 602 条受控 prompt、21,143 条搜索层引用的研究中,每条回答的平均引用数为:ChatGPT 6.88,Google 的 AI 界面 12.06,Perplexity 16.35。5 成为七个被引来源之一,和成为十六个之一,不是同一件事。所以基于引用的声量份额,在“偏好”这个问题出现之前就已经不能跨引擎比较了;这也是衡量 AI 可见度这一阶段 里按引擎拆分并非风格选择的又一个理由。

基于提及的声量份额是两者中更稳健的一个,因为正文长度在引擎之间的波动远小于来源数量的波动。必须二选一时就报这一个,并写明你报的是哪一个。

位置

你出现在答案里的什么位置,重要吗?

答案内位置值得记录,同时它是六者中作为业务指标证据最弱的一个。它之所以存在,是因为开创这个领域的那篇论文把头条指标建在了它上面:KDD 2024 的 GEO 论文用“位置调整词数”给来源打分,该指标按归因给某个来源的词在回答中所处的位置,用一个指数衰减函数加权。1 那是一个定义良好的测量,而它是对着生成答案的其他属性被验证的,不是对着点击、转化或收入。

两条规则仍能让它可用。只在面板层面聚合着读,因为单条答案的排序只是一个每次运行都会重掷的分布中的一次抽样。以及把它当序数读而不是当距离读:三选一里的第一和十六选一里的第一,不是同一个位置。

保真度

为什么表述准确度要单独计?

表述准确度要单独计,因为其余每一个指标都会把一句关于你的假话记成成功。如果某个引擎写下“该产品没有免费档”,而事实上你有,并且它还在这句话旁边挂上了你的定价页,那么你的提及率、引用率、声量份额和位置全都变好了。唯一朝正确方向变动的那个数字,恰恰没人在收集。

基础错误率本身就足以证明这份力气值得花。哥伦比亚大学 Tow 数字新闻中心 2025 年 3 月 6 日发布的审计跑了 1,600 条查询,覆盖二十家出版方、每家十篇文章、八个引擎,发现超过 60% 返回了错误答案,而表现最好的那个引擎仍有 37% 出错。6 另一项关于生成式搜索的独立研究发现,答案中只有 51.5% 的句子被其所挂的引用完全支撑。7 这两项研究测的都不是品牌,而它们测的正是这里要紧的性质:挂上链接并不能让那句话变成真的。关于如何低成本地抽样测这一项,见姊妹篇哪些指标站得住

第六个量

为什么要记录所有人的被引用 URL,而不只是你的?

记录每一个被引用的 URL,而不只是指向你的那些,正是把一个可见性数字变成“这周该做的事”的那一步。你自己的比率告诉你身处何处;完整的引用清单告诉你,站在你本该站的位置上的是什么东西。

由它直接得出三件事。在你的“选型类”prompt 中反复出现的第三方页面,比如一篇对比合集、一条论坛帖、一个目录收录,就是站外工作的靶子,而且它们是按你自己面板里的出现频次排序的,不是按任何人的权威分。你自己的页面会分成“被引用过的”和“从来没被引用过的”两堆,这把内容待办变成了一份有序的待办。而那些引用了关于你的过时事实的页面,比如一个旧价格、一个已下线的集成,构成一份纠错清单,那是与内容工作不同的另一件活。

这一切只有在日志是原始记录时才成立。每次运行请存下:引擎与模式、如果暴露则记录模型版本、prompt 标识及其类别、时间戳、完整答案原文、按出现顺序的每一个被引用 URL,以及一个“正文中是否出现你的品牌名”的标记。这六个量都能从这条记录算出来,从事后补写的摘要里则一个都算不出来。2026 年那篇批判性综述的最低研究清单要求的是同样的纪律,包括大多数团队会破坏的那一条:把“什么都没发生”的那些运行留在分母里。2

本文的诚实边界

这六个量里有两个,没有任何已发表的证据把它们和企业真正在意的东西连起来。答案内位置来自一个对着生成文本的其他属性被验证的指标,从未对着点击或收入被验证过。声量份额则完全没有外部验证:它是一个谁都能自行定义的比值,也没有研究检验过“把它推高”是否会带动别的什么。该领域自己 2026 年的综述把“引用分数预测点击、转化或收入”评为极低置信度,而这个评级覆盖全部六项。上文引用的 62%“有链接不点名”来自一份 115 条 prompt 的厂商样本,没有复现。使用这六个量,是因为这套拆分能让你的决策变得清晰可辨,而不是因为其中任何一个已被证明是销售的先行指标。

产品在哪里派得上用场,在哪里派不上

这六个量你完全可以手工收集,而上面写的就是全部方法:定一份 prompt 清单,按计划跑,把每条答案连同它引用的 URL 粘进表格,再标注正文里有没有出现你的名字。一个月一百次运行是一个下午的工作量,而它产出的是一个站得住脚的数字。Bavior 按计划把固定 prompt 面板打到五个引擎上,记录每一个被引用的 URL(包括不属于你的那些),并按引擎分别汇报而不是给一个综合分。它不做的事情是:从这六个量中的任何一个推算流量或收入,因为该领域自己的综述把这条关联评为极低置信度;它也不替你判定表述准确度,因为“关于你产品的这句话是否属实”要靠人去读答案,而不是靠一个分类器。免费可见性检测免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 29 日)。

出处,全部核查于 2026 年 8 月 29 日
  1. Aggarwal、Murahari、Rajpurohit、Kalyan、Narasimhan、Deshpande,《GEO: Generative Engine Optimization》,KDD ’24;“位置调整词数”按位置的指数衰减函数给归因文本加权:arxiv.org/abs/2311.09735
  2. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035;含置信度表、最低研究清单,以及“分别测量检索、引用与保真度”的指引(综述预印本):arxiv.org/abs/2607.14035
  3. Grossman 等,SIGIR 2026;11,500 条查询;Google 自然结果、AI Overviews 与 Gemini 之间 URL 层的 Jaccard 为 0.11–0.18:arxiv.org/abs/2604.27790
  4. “幽灵引用”研究,2026 年 6 月发布:115 条 prompt、3,981 次域名出现、四个助手、十四个国家;约 62% 的来源出现属于“答案从未点名其品牌”的链接;一个助手为 83.7% 提及 / 21.4% 引用,另一个为 20.7% / 87%。厂商发布;按本课程的出处规则,只描述、不链接。
  5. Zhang、He、Yao,《From Citation Selection to Citation Absorption: A Measurement Framework for GEO Across AI Search Platforms》,arXiv:2604.25707(预印本);602 条受控 prompt、21,143 条搜索层引用;每条回答平均引用数 6.88 / 12.06 / 16.35:arxiv.org/abs/2604.25707
  6. Jaźwińska 与 Chandrasekar,哥伦比亚大学 Tow 数字新闻中心,《AI Search Has a Citation Problem》,2025 年 3 月 6 日;跨八个引擎的 1,600 条查询:cjr.org
  7. Liu、Zhang、Liang,《Evaluating Verifiability in Generative Search Engines》,2023;答案中 51.5% 的句子被其引用完全支撑:arxiv.org/abs/2304.09848
常见问题

你想知道的,都在这里。

被提及和被引用,哪个更好?

它们回答的是不同的问题,所以有用的做法是两个都报、并且读它们之间的差。提及是读者看得见的东西,而多数读者从不点击来源,所以一次没有链接的提及照样触达了那个人。引用则是可被机器核验的那一半:它意味着你的页面被检索并被挂上了,而这恰恰是你自己的工作能直接影响的部分。如果你被引用却没被点名,就去修页面上的句子,让事实和品牌名出现在同一句里。如果你被点名却没被引用,那段描述来自训练数据,只有第三方发布的内容才会慢慢改变它。

一个小团队实际上该跟踪这六个里的几个?

四个,而通常被跳过的正是第四个。按引擎分别跟踪提及率和引用率,因为它们会分化,而分化的方向本身就是一个诊断;跟踪基于提及的声量份额,对照一个你明确写出并冻结的竞品集合;并且记录答案里每一个被引用的 URL,包括竞品的和所有第三方的,因为这份清单是数据中唯一能指出行动的部分。答案内位置值得记录,但不值得据以决策。表述准确度值得每月人工抽样一次,而不是每次运行都测,因为它需要有人去读那句话。

我能把这六个数字加总成一个可见性总分吗?

不能,因为它们量纲不同、分母不同,而且加总会毁掉它们唯一能支撑的那些决策。提及率和引用率是“占答案的比例”;声量份额是品牌之间的比值;位置是序数;表述准确度是由人工判定的陈述占比。把它们平均,得到的数字既无法告诉你该去修哪个引擎,也无法告诉你六项中哪一项出了问题。更何况每一项都是按引擎测量的:SIGIR 2026 的一项研究测得同一家公司旗下三个界面之间的 URL 层 Jaccard 只有 0.11–0.18,所以跨引擎的综合分,平均的是几乎不重叠的东西。

每次运行该记录什么,才能事后算出这六个量?

七个字段,原样记录:引擎与模式、如果暴露则记录模型版本、prompt 标识及其类别、运行时间戳、完整答案原文、按出现顺序排列的每一个被引用 URL,以及一个“正文中是否出现你的品牌名”的标记。这六个量都能从这条记录算出来,而没有一个能从事后写的摘要里算出来。请保留那些“什么都没发生”的运行:2026 年那篇批判性综述的最低研究清单明确要求把空结果留在分母里,而删掉它们,是一个面板开始自我美化的最常见方式。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

是六个数字,不是一个。
先从互相矛盾的那两个开始。

免费试用