“结论”这一列不是按精确度或成本给指标排序,活下来的四个里有好几个又贵又吵。它排的是“一次变动是否意味着一个行动”:某个引擎上提及率的下跌会把你指向那个引擎的引用清单,而综合分的下跌不会把你指向任何具体的地方。这六个底层量的定义写在姊妹篇“可见性到底指什么”里。
哪些 GEO 指标站得住,哪些站不住?
这个品类里的每一个指标都有自己的失效方式,而知道它,正是“一个可以据以行动的数字”与“一个你必须辩护的数字”之间的分界。跨引擎综合分是仪表盘的默认输出,而它毁掉了自己唯一支撑的那个决策。
本页内容
四个 GEO 指标站得住:按引擎分别汇报并带区间的提及率与引用率、对照一个由你具名并冻结的竞品集合的声量份额,以及由人工抽样阅读的表述准确度。四个站不住:单一的跨引擎综合分、单条 prompt 的周环比箭头、任何由引用推算出的流量或收入数字,以及情感打分。综合分败得最彻底,因为 SIGIR 2026 一项 11,500 条查询的研究测得,Google 自然结果、AI Overviews 与 Gemini 所检索到的来源之间,Jaccard 相似度只有 0.11 到 0.18。1
关键要点- 一个指标站得住的唯一标准,是它一动就会改变某个人接下来该做的事。
- 按引擎分别汇报并印出区间:跨引擎的平均值会把真正动了的那两个引擎藏起来。
- 不要把引用换算成流量或收入。皮尤研究中心发现,用户在约 1% 的访问中点击了 AI 摘要内的来源。8
哪些指标经得起检验,哪些经不起?
一个指标经得起检验,标准是它一动,就会有人该做的事跟着变;下面八个里有四个过得了这一关,四个过不了。
最有用的是最后一列:它写明了什么样的观察会证明某次解读是错的。
| 指标 | 结论 | 什么会让对它的解读变成错的 |
|---|---|---|
| 按引擎分的提及率,带区间 | 站得住 | 区间与上一期重叠,或两期之间面板版本变过 |
| 按引擎分的引用率,带区间 | 站得住 | 它与提及率反向变动,而你只报了其中一个 |
| 固定竞品集合下的声量份额 | 站得住 | 在对比窗口内有品牌进入或退出了统计集合 |
| 人工抽样阅读的表述准确度 | 站得住 | 两位阅读者按同一评分表判断,分歧超过五分之一 |
| 答案内位置 | 谨慎使用 | 只看单条答案,或拿引用来源数量不同的引擎互相比较 |
| 单一的跨引擎综合可见性分 | 站不住 | 永远:各成分独立变动,平均值没有所指 |
| 带周环比箭头的单条 prompt 分数 | 站不住 | 变动幅度小于“一条 prompt 跑几次”的区间 |
| 由引用推算的流量或收入 | 站不住 | 永远:连接两者的那个系数从未被测量过 |
跨引擎综合分为什么会毁掉它自己的决策?
综合分之所以毁掉自己的决策,是因为可见性指标唯一能支撑的行动就是“下一步该修哪个引擎”,而跨引擎取平均恰好把这条信息删掉了。它几乎是这个品类里每一个仪表盘的默认输出。
先看引擎之间共享的东西有多少。SIGIR 2026 上一项 11,500 条查询的研究测得,Google 自然结果、AI Overviews 与 Gemini 之间 URL 层的 Jaccard 相似度为 0.11–0.18。1 具体地读:如果两个界面对同一个问题各引用十个 URL,Jaccard 为 0.15 意味着大约三个 URL 同时出现在两份清单上,两份清单合起来大约有十七个不同的 URL。而这三个界面是同一家公司、同一套索引、同一个产品家族里的。两个互不相干的助手之间,重合还要更低。2026 年那篇批判性综述用一句值得原样引用的话给出了结论:这些结果“否定了存在全局 GEO 排名的观念。可见性是按引擎和按界面索引的。”2
再看取平均对真实的一周做了什么。假设你的提及率在一个引擎上涨了 8 个百分点,在另一个上跌了 6 个,在其余三个上持平。综合分大约动半个点,报告写着“稳定”。有两个引擎刚刚发生了值得调查的事,而那个本该把它暴露出来的数字,把两件都藏起来了。问题不在于不精确,而在于这个聚合值是对一组本就不在测同一件事的量做了一次表现良好的平均。至于这种分歧背后的机制,也就是不同的抓取令牌、不同的查询扩展、不同的来源数量预算和不同的来源类型偏好,在《AI 引擎彼此一致吗?》里有完整推演。
跨引擎汇总有一种正当用法,而它不是一个分数:数一数你在多少个引擎上越过了某个门槛。“在五个引擎中的三个上,至少四分之一的答案点到了我们”是一句站得住脚的总结,因为它是对若干条各自可辩护的事实做计数,而不是对不可通约的量取平均。
表述准确度为什么是没人愿意买的指标?
表述准确度之所以没人愿意买,是因为它无法自动化,而且会让报告显得更难看;它之所以人人都需要,是因为其余每一个数字都会把“一句自信而错误的产品描述”记成胜利。它也是这八个里唯一一个由独立研究给出了基础错误率的指标,而那个基础错误率很糟。
三项独立测量,三种不同方法,同一个方向。哥伦比亚大学 Tow 数字新闻中心 2025 年 3 月 6 日发布的审计跑了 1,600 条查询(二十家出版方、每家十篇文章、八个引擎),发现超过 60% 返回了错误答案,而表现最好的那个引擎仍有 37% 出错。3 同一中心 2024 年 11 月针对 20 家出版方 200 条引文的研究发现,200 条回答中有 153 条部分或完全不准确,而在两百条里只有七次表达了不确定。4 另一项关于生成式搜索的独立研究发现,答案句子中有 51.5% 被其所挂引用完全支撑;5 2026 年一篇预印本把 98,020 条原子主张中约 11% 判定为支撑不足。6 最后这个数字远低于前面几个,是因为它计的是“主张”而不是“回答”;一条回答只要有一处主张出错就算错,所以按回答计的比率必然高得多。你想引用哪一个都行,但请把单位一起带上。
在你自己产品上测这一项,比上面那些研究听起来便宜得多。每月抽二十条答案,向“出错会丢单”的 prompt 类别倾斜:对比类和异议类。对照一份固定评分表给每条答案打分,事实维度控制在少数几个:定价模式、产品做什么、产品不做什么、集成能力,以及任何合规或安全方面的说法。每个维度记二值,而不是记情感;并且把说错的那句话原样记下来,好拿去给那个页面的负责人看。两位阅读者应当在五条里至少四条上判断一致;如果做不到,是评分表太含糊,而不是引擎太善变。
产出不是一张幻灯片上的百分比,而是一份“具体的假句子 + 最可能造成它的页面”清单,这是任何 AI 可见性项目能产出的最可执行的东西。拿到这份清单之后该做什么,见《引用准确度》。
声量份额脆弱在哪里?
声量份额脆弱,是因为它是活下来的指标里唯一一个分母属于判断而非事实的,所以它可以在现实世界什么都没发生的情况下被挪动好几个点。往统计集合里加两个次要竞品,你的份额就降;悄悄把它们去掉,份额就升。两种变动都是人为产物。修它的纪律不是统计性的:在报告里写明竞品集合,本季度冻结它,给它版本号,并把版本号印在数字旁边。
还有第二重脆弱性,它是结构性的,纪律修不了,只能披露。基于引用的声量份额有一个依赖引擎的分母,因为不同引擎给一条答案挂的来源数量差别极大。2026 年 6 月 26 日发布的一份 AI 可见性指数,基于 2026 年 1 月至 4 月采集的 1.26 亿条美国 AI 搜索 prompt,报告一个助手每条回答平均引用约 15 个来源,另一个约 3 个,并发现在它覆盖的所有平台上都保持可见的品牌只有 36 个。7 这是厂商发布的数据,但方向与学术界对“每条回答引用数”的测量一致,所以请把这个比例关系当作真实的,把具体均值当作指示性的。成为三个被引来源之一,和成为十五个之一,不是同一件事;因此基于引用的份额不能跨引擎比较,而基于提及的份额是更安全的默认选项。
哪些数字根本不该出现在仪表盘上?
有四个数字根本不该出现在仪表盘上,而且它们各自失败的原因不同,都不是“不够精确”。第一个是任何由引用推算出的流量或收入数字。允许这种换算的那个系数从未被测量过:该领域自己 2026 年的综述把“引用分数预测点击、转化或收入”评为极低置信度,2 而皮尤研究中心 2025 年 7 月的浏览行为研究发现,用户在约 1% 的访问中点击了 AI 摘要内的来源。8 用一个编出来的点击率去乘引用数,产出的不是估计值,而是一个带着未知误差项和一个小数点的数字。
第二个是带周环比箭头的单条 prompt 分数。一条 prompt 跑几次所带的区间,远宽于任何值得汇报的变动,所以那根箭头是画在噪声上的;算术过程见姊妹篇《统计功效》。第三个是情感打分,它会把你真正需要的信号压扁:一条答案可以语气温和,同时把你的定价模式说错,而让你丢单的正是那个错误。请改测表述准确度。
第四个是任何“公式没有印在旁边”的综合指数。如果一个数字是“出现、位置、显著度”的加权混合,那么权重本身就是结论;而看不到权重的读者,无法核对上一季度的数字是不是用同一套算法算出来的。有公开公式的指数是一个指标;没有公开公式的指数是一个主张。
怎么判断一个新指标值不值得加?
把候选指标放进四个问题里过一遍,四个都答得上来才加。它有没有一个你掌控且能写出来的分母?如果分母是引擎的流量、它的 prompt 量或它的用户规模,你写不出来,那么这个指标就是一个戴着百分号的猜测。你能不能围绕它算出一个区间?如果底层观察不是“在一组可数的运行上发生的可数事件”,就没有区间,也就没有办法把变化与波动区分开。
它变动时,会有决策随之改变吗?在开始收集之前就写下来:一个两倍标准误的变动会触发哪个具体动作。如果你说不出一个,这个指标就是装饰,而它会占掉一页上有限的注意力。它能被证伪吗?写明什么样的观察会显示某次解读是错的:上面那张表的最后一列就是为了逼出这一点。一个没有证伪观察的指标,测的不是任何东西,它描述的是一种情绪。
在加新东西之前,先把你现有的仪表盘也过一遍这四个问题:在多数项目里,有两三个面板光是第三问就过不去。
本页给出的结论是论证,不是测量。没有任何研究把这八个指标放在一起比较过预测效度,因为那需要有一个被预测的结果,而人人都想要的那个结果,也就是收入,恰恰是该领域自己的综述评为极低置信度的那一个。所以这里的“站得住”意思是“有可陈述的分母、可计算的区间和挂钩的决策”,而不是“已被证明能带来销售”。表述准确度是活下来的四个里定义最弱的一个:没有标准评分表,也不存在针对这项任务的公开评分者一致性数据,而上面引用的基础错误率来自针对新闻出版方的研究,不是针对产品的。总会有人发表一份更好的评分表,而它会改变本页的建议。
上面的一切都能在电子表格里做完:定住面板、跑起来、按引擎分别统计“正文点名”和“挂了 URL”、给每个比率算一个二项区间,再每月对照你自己写的评分表读二十条答案。Bavior 按计划把固定 prompt 面板打到五个引擎上,并按引擎分别汇报而不是给一个综合分,正因为综合分无法告诉你该去修哪个引擎;它也记录每一个被引用的 URL,包括不属于你的那些。它不做的事情是:由引用推算流量或收入,因为那个系数并不存在;它也不给表述准确度打分,因为判断“关于你产品的这句话是否属实”要靠人对照你的评分表去读答案,而不是靠一个分类器。免费可见性检测和免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 29 日)。
- Grossman 等,SIGIR 2026;11,500 条查询;Google 自然结果、AI Overviews 与 Gemini 之间 URL 层的 Jaccard 为 0.11–0.18:arxiv.org/abs/2604.27790
- 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035;含置信度表,以及“这些结果否定了存在全局 GEO 排名的观念。可见性是按引擎和按界面索引的”(综述预印本):arxiv.org/abs/2607.14035
- Jaźwińska 与 Chandrasekar,哥伦比亚大学 Tow 数字新闻中心,《AI Search Has a Citation Problem》,2025 年 3 月 6 日;1,600 条查询、20 家出版方、8 个引擎;超过 60% 有误:cjr.org
- 哥伦比亚大学 Tow 数字新闻中心,《How ChatGPT Search (Mis)represents Publisher Content》,2024 年 11 月;来自 20 家出版方的 200 条引文;200 条回答中 153 条部分或完全不准确:cjr.org
- Liu、Zhang、Liang,《Evaluating Verifiability in Generative Search Engines》,2023;答案中 51.5% 的句子被其引用完全支撑:arxiv.org/abs/2304.09848
- Xu、Iqbal 与 Montgomery,2026;98,020 条原子主张中约 11% 被判定为支撑不足(预印本):arxiv.org/abs/2605.14021
- 某 AI 可见性指数,2026 年 6 月 26 日发布:1.26 亿条美国 AI 搜索 prompt,采集于 2026 年 1 月至 4 月;一个助手每条回答平均引用约 15 个来源,另一个约 3 个;在其覆盖的所有平台上都保持可见的品牌只有 36 个。厂商发布;按本课程的出处规则,只描述、不链接。
- 皮尤研究中心,2025 年 7 月 22 日;用户在约 1% 的访问中点击了 AI 摘要内的来源:pewresearch.org
你想知道的,都在这里。
有没有一个我该对标的 AI 可见性基准分?
没有,任何被拿来当基准的数字,比较的都是本就不可比的面板。你的比率是你所选 prompt 的函数:一个只测窄漏斗底部问题的团队,会比一个测宽泛品类问题的团队数字更低,哪怕产品是同一个,而两个数字之间互相说明不了任何事。真正有意义的比较有两个:你自己的面板在固定版本下与自己的历史比,以及在同一天、同一面板内相对于一个具名竞品集合的声量份额。两者都是内部比较,而这恰恰是它们站得住脚的原因。
我的仪表盘只给一个 AI 可见性总分,它没用吗?
它作为一个报警器不算没用,作为一个诊断则确实没用,这个区分值得记住。一个综合数字能告诉你“有东西动得够大,值得去看一眼”。它无法告诉你是哪个引擎动了;而既然 SIGIR 2026 的研究测得同一家公司旗下三个界面之间的 URL 层 Jaccard 只有 0.11–0.18,这些成分几乎是彼此独立的。如果它已经在页面上,那就留着,但要在它下面印出按引擎的拆分,并确保任何人采取的每一个行动,都是由拆分触发的,而不是由综合分触发的。
不额外招人的话,怎么测表述准确度?
每月对照一份固定评分表读二十条答案,把每个事实维度打成“对/错”的二值。维度要挑那些真会让你丢单的:定价模式、产品做什么、产品不做什么、集成能力,以及任何合规或安全方面的说法;并且请把说错的那句话原样记下来,而不是记一个分数,因为能拿去行动的是那句话。抽样要向对比类和异议类 prompt 倾斜,那里出错代价最高。两位阅读者应当在五条里至少四条上判断一致;如果做不到,是评分表太含糊,而不是引擎太善变。
为什么不能把引用换算成一个预估流量数字?
因为你要乘上去的那个系数从来没有被测量过,而唯一相关的公开数字说明它接近于零。皮尤研究中心 2025 年 7 月的浏览行为研究发现,用户在约 1% 的访问中点击了 AI 摘要内的来源;该领域自己 2026 年的综述则把“引用分数预测点击、转化或收入”评为极低置信度。你仍然可以把一个建模假设明说出来:“如果 1% 的读者会点击、而这条 prompt 被问了 N 次”,前提是你把它呈现为一个 N 未知的假设,而不是一次测量。它一旦以图表形式出现,就会被当成测量来引用。
负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。
发现数字有误?告诉我们,我们会重新核查:support@bavior.com