首页/学习 GEO/测不了的东西
衡量 AI 可见度 · 边界

AI 可见性测量的边界在哪里?

这个领域有四个问题根本没有仪器,而假装有,正是 GEO 报告失去公信力的主要方式。有用的做法是把每一个的边界大声划出来,而不是偷偷估一个数。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

AI 可见性里有四样东西没有仪器:一条 prompt 被问过多少次、一次引用带来了多少收入、模型在不搜索时会怎么说你,以及某一个具体买家真正看到的那条回答。它们都不是在等更好的工具,而是缺了本该有的那次观察,所以正确的做法是把边界大声划出来,而不是偷偷估一个数。就第二样而言:皮尤研究中心 2025 年 3 月的浏览面板发现,在出现 AI 摘要的页面访问里,只有 1% 的访问中用户点击了摘要内的链接,所以这类触点大多不会给分析工具留下任何事件。2

关键要点
  • 报覆盖度,不要报量级:没有引擎公开 prompt 频次,所以提及率描述的是你所选的那些问题,永远不是市场份额。
  • 不要把引用换算成收入。该领域自己 2026 年的综述把“引用分数预测点击、转化或收入”评为极低置信度,也就是最低的一档。3
  • 用三句话给每个缺口划边界:写明被估量、写明你实际拥有的仪器,再写明什么样的观察会显示这次解读是错的。
缺失的分母

为什么没人能告诉你,你那条 prompt 被问过多少次?

没有引擎公开 prompt 频次,也没有任何东西能还原它,所以你报出的每一个比率,都是“分子你测过、分母你编的”。这个数字为什么不存在,以及厂商给出的 prompt 量级到底是由什么拼出来的,在提示词研究这一阶段 里有完整推演。对一份报告来说要紧的是后果:你的提及率是你所选问题的性质,不是市场的性质。

这对“报告可以主张什么”有一个具体影响。“我们在 34% 的答案里被点名”是一句关于你面板的、站得住脚的话。“我们在本品类 34% 的 AI 答案里被点名”不是,因为后一句暗含了一个谁都没有的分母。把面板写进句子里,这句话就变成真的了。

你能拿到的边界是覆盖度,而不是量级。把你能观察到的需求拿出来:你自己搜索后台里的问句型查询、发现型通话的第一个问题、试用第一周开的工单。说明你的面板覆盖了其中多大比例,你就有了一个有真实分母的真实分数,也是这里能做出的最强覆盖度主张。有一个已发表的信号能帮你给面板加权:一项 55,393 条查询、采集于 2026 年 3 月 13 日至 4 月 21 日的研究测得,Google AI Overview 的触发率整体为 13.7%,而问句形式的查询为 64.7%。1 AI 答案发生在问句形状的 prompt 上,所以一个向问句倾斜的面板,测的是这个界面真正存在的地方。

归因

一次引用能被归因到收入上吗?

不能,而原因是机制性的而非统计性的:在通常情况下读者根本不点击,所以没有任何事件可供分析系统记录。皮尤研究中心 2025 年 3 月的浏览面板测得,点击 AI 摘要内来源的比例约为访问的 1%;至于一次引用作为“曝光”值多少,见GEO 与 SEO这一阶段2 该领域自己 2026 年的综述把“引用分数预测点击、转化或收入”评为极低置信度,也就是它的最低档。3

有三个机制切断了这条链条,而知道当下起作用的是哪一个,才知道哪种绕行方案值得一试。第一是缺失的点击:一个被答案满足了的读者,永远不会变成一次会话。第二是缺失的 referrer:聊天客户端常常根本不发送 referrer,所以确实发生了的访问会以直接流量的形式到达。第三是无法区分的智能体:哥伦比亚大学 Tow 数字新闻中心 2025 年 10 月 30 日发布的分析写道,对一个网站来说,智能体浏览器里的代理“与一个使用标准 Chrome 浏览器的人无法区分”,而且这类浏览器取到了同一批厂商的标准界面取不到的订阅专享内容。4 这一类流量增长很快:Cloudflare 全网 2025 年度回顾报告,用户触发型抓取在这一年里增长超过十五倍。5 因此,你的 AI 中介触点里“在分析工具中不可见”的那一部分,占比是在上升而不是下降。

没有任何绕行方案能把那个缺失的系数找回来,任何被当作解决方案端上来的东西都值得你怀疑。请把一个建模假设写成一句话,输入项写明、未知项标为未知,并且绝不把它画成图表。图表到第二次开会时就会被当成测量结果引用。

另一种回答

你能测出模型在不检索时会怎么说你吗?

你能抽样,但没法做时间序列,因为仪器本身在你脚下变。当模型不搜索就作答时,关于你产品的那段描述来自你无法检视、无法编辑、也无法按计划影响的训练数据。今天要抽样很容易:关掉搜索问一遍,读回来的东西就是。问题出在第二次测量。

时间序列需要一个固定的仪器,而模型不是。每一次发布都意味着新的语料、新的截止时间和新的后训练,所以两次“不带搜索”的测量之间的变化,可能是你的口碑变了,也可能是模型变了,而数据里没有任何东西能区分这两者。连版本标签往往也帮不上忙:同一个产品名可以在不同检查点之间切换而不作公告。2026 年那篇批判性综述把“商业引擎彼此不同且随时间变化”评为置信度,而这恰恰是一个“无检索时间序列”必须摆脱、却摆脱不了的东西。3

所以请把“关搜索的那次运行”当作一次周期性快照,盖上模型版本号,定性地读。它回答的是一个确实有用的问题:当这个系统什么都不读时,它认为我们是什么。它也是你能拿到的、关于“某个错误事实已经沉淀进语料”的最早预警。请把它作为带日期和版本的引文原样呈现,绝不要做成趋势线。

一次运行,一个会话

你能测出某个真实买家看到的那条回答吗?

不能,而这条限制最常被误当成数据里的噪声。一个面板跑的是无尘室式的会话:全新上下文、没有登录账号、固定地区、开着搜索、每条 prompt 只跑一次。真实买家不会把这些变量摁住不动。Anthropic 在文档里写明,Claude“在你聊天时把记忆按一个个独立主题保存下来”,并会把它带进后续对话,而用户也可以把这个功能关掉;于是两个问同一个问题的人,其实并不是在问同一个系统。7 你跑的任何一次,都复现不出他们的状态。

另一半是非确定性,而它与个性化不同,至少还能被量化。2026 年 3 月那篇 AI 可见性测量的统计学论文写道,“引用排名在不同样本之间并不稳定,不只是排名靠前的域名,整个高频被引域名集合都如此”,而自助法置信区间显示,域名之间许多看似存在的差异,其实落在“这套测量过程的噪声底”之内。6 2026 年那篇批判性综述从审计一侧记录了同样的图景:商业审计显示出“很低的来源重合度、相当大的逐次运行波动,以及持续存在的保真度缺口”。3

由此得出的实操规则是:不要再把一次运行当成一次观测。把每条 prompt 重复跑,用区间而不是点值来报比率,只有当周环比的变化超出那个区间时才把它当成真实变化;该综述自己的清单也正是出于这个理由,要求研究做多种改写与重复。3 至于要重复多少次,那是算术,统计功效那一篇把它算清楚了。重复永远换不来的,是那位买家自己看到的回答;它始终不可观测,所以请把你的会话设置写在数字旁边,而不是塞进附录。

代理指标

哪些代理指标值得留,又该怎么标注?

有三个代理指标值得留,而每一个都只有在带着“它撑不起什么”的明确标注时才安全。

01

用户自报的来源

注册时那个自由填写的“你从哪里知道我们的”,是买家唯一能告诉你“有个助手参与其中”的地方。标注:自选样本、无提示回忆,且会被那些根本不记得这次触点的人系统性地低报。

02

高意图页面的爬虫抓取

搜索侧与用户触发型抓取器对你定价页、对比页的抓取,是真实的需求信号,详见爬虫日志那一篇。标注:兴趣的先行指标,不是结果,也无法归因到具体的人。

03

品牌词与直接流量

品牌搜索或直接访问的上升与提及率的上升同时出现,是一种弱佐证。标注:与同一窗口内其他所有营销动作混淆在一起,没有对照期时毫无用处。

标注本身就是这里的全部纪律。一个被剥掉注意事项的代理指标,在转述中就会变成一次测量,所以请把注意事项写进图表标题里,而不是放在脚注里;这样当这张幻灯片在你不在场时被转发出去,那个数字仍然是诚实的。

方法

怎样给一个测不了的问题划边界?

给一个问题划边界,意思是用“一个写明的区间加一个写明的假设”去回答它,而不是给一个点估计;这只需要三句话。写明被估量:准确写下你希望自己知道的是什么,比如“上个季度有多少买家是在某个助手里形成了对我们的看法”,因为含糊的版本,正是让代理指标偷偷顶替它的入口。写明仪器:说清你实际拥有的是什么、它测的是什么,于是“一个 200 次观测的面板”测的就是你所选的那些问题中有多大比例点到了你,在五个引擎上、在某个日期范围内。写明证伪条件:说清什么样的观察会显示这次解读是错的;对一个边界来说,这通常意味着写明“哪个假设一旦不成立,它就垮了”。

写出来,一条带边界的主张长这样:“在我们 60 条 prompt 的面板上,7 月里五个引擎中有四个在 28–36% 的答案中点名了我们,每个引擎 200 次观测。我们不知道这些问题被问的频率,所以这不是市场份额。如果我们的买家问的问题与我们的面板有实质差异,这个数字并不描述他们。” 这一段比多数高管摘要都短,而且没法被断章取义,这正是重点。

同样的纪律,也是研究文献对自己的要求。2026 年那篇批判性综述的建议是先做出一个可检索的页面,然后“分别测量检索、引用与保真度”;它的最低研究清单要求每次读数都记录产品、模式、模型、日期、地区、账号以及是否开启搜索,并要求保留零结果而不是把它们丢掉。3 这些都不阻止你去测量。它们阻止的是让一次测量去承担它从来就不是为之而建的主张。

本文的诚实边界

这里描述的四条限制是今天的结构性限制,不是自然规律,其中两条有可能被填上。如果哪天有引擎公开了 prompt 频次,或者助手开始传递一致的 referrer,本页前两节会在一个季度内过时,而这会不会发生,事先无从知道。另外两条更难:一条“无检索时间序列”需要固定的仪器,而一个被重新训练过的模型不是;而某一个人看到的那条回答,除了他本人没有任何人能观测。也请对这里引用的最强那个数字保持谨慎:约 1% 的点击率来自 2025 年 3 月一个 900 名美国成年人的行为面板,测的是 Google 的 AI 摘要这一个界面;它是目前最好的独立证据,而它是一项研究、一个界面、一个国家、一个月份。

产品在哪里派得上用场,在哪里派不上

划边界不花钱,只花纪律:把被估量、仪器和证伪条件写进报告,在注册环节加一个自由填写的来源字段,并且停止把引用换算成会话。Bavior 按计划把固定 prompt 面板打到五个引擎上,记录每一个被引用的 URL(包括不属于你的那些),并按引擎分别汇报而不是给一个综合分。它不做的,恰恰就是本页这四件事:它无法告诉你某个问题被问过多少次,因为没有引擎公开这个;它不由引用推算流量或收入,因为该领域自己的综述把这条关联评为极低置信度;它也无法告诉你“模型在不搜索时认为你是什么”,除了让你自己去读一张快照;它更无法把某一个买家看到的那条回答拿给你看,因为那是他自己的会话。免费可见性检测免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 29 日)。

出处,全部核查于 2026 年 8 月 30 日
  1. Xu、Iqbal 与 Montgomery,2026;55,393 条查询,采集于 2026 年 3 月 13 日至 4 月 21 日;原文为“overall AIO activation is 13.7%, rising to 64.7% for question-form queries”(预印本):arxiv.org/abs/2605.14021
  2. 皮尤研究中心,2025 年 7 月 22 日;900 名美国成年人的浏览面板、68,879 次搜索,数据采集于 2025 年 3 月;关于点击 AI 摘要内的链接,原文为“this occurred in just 1% of all visits to pages with such a summary”:pewresearch.org
  3. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035;含置信度表与最低研究清单(综述预印本):arxiv.org/abs/2607.14035
  4. Chandrasekar 与 Jaźwińska,哥伦比亚大学 Tow 数字新闻中心,《How AI browsers sneak past blockers and paywalls》,2025 年 10 月 30 日;智能体浏览器“与一个使用标准 Chrome 浏览器的人无法区分”:cjr.org
  5. Cloudflare Radar 2025 年度回顾,数据区间 2025 年 1 月 1 日至 12 月 2 日;原文为“AI ‘user action’ crawling increased by over 15x in 2025”:blog.cloudflare.com
  6. Sielinski,《Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement》,2026 年 3 月,2026 年 8 月 26 日修订版,arXiv:2603.08924(预印本):arxiv.org/abs/2603.08924
  7. Anthropic,《Use Claude’s chat search and memory to build on previous context》(跨对话保存的记忆,用户可关闭;第一方):support.claude.com/en/articles/11817273
常见问题

你想知道的,都在这里。

我怎么知道有多少人在向 AI 问我这个品类的问题?

你没法知道,因为没有引擎公开 prompt 频次,也没有任何代理指标能还原它。你能诚实测量的是“覆盖度”而不是“量级”:把你确实观察到买家问过的问题拿出来,也就是你自己搜索后台里的问句型查询、发现型通话的第一个问题、试用期开的工单,然后说明你的面板覆盖了其中多大比例。“这个面板覆盖了我们观察到的 55 个不同问题中的 40 个”是一句有真实分母的真话;“我们出现在本品类 34% 的 AI 答案里”不是,因为那个分母谁都没有。

我能给董事会一个 AI 可见性带来的收入数字吗?

不能作为一次测量给出,但你可以给出一个带边界的说法。从引用到收入的链条在三处断掉。第一,读者通常不点击:皮尤研究中心 2025 年 3 月的浏览面板测得,点击 AI 摘要内来源的比例约为 1%。第二,聊天客户端常常不发送 referrer,所以确实发生的访问会以直接流量的形式到达。第三,智能体浏览器在服务器日志里与真人无法区分。请写一句点明假设、并把未知项标为未知的话,并且不要把它做成图表,因为图表会被当成测量结果引用。

我该跟踪“关掉搜索时模型怎么说我”吗?

请周期性地抽样、给它盖上模型版本号,并把它当文本来读,而不是画成曲线。不带搜索的回答来自你既无法检视也无法编辑的训练数据,这让它成为“关于你产品的某个错误事实已经沉淀进语料”的最早预警,这确实值得知道。它撑不起来的是时间序列,因为每一次模型发布都是新的语料和新的截止时间,所以两次测量之间的变化可能是模型变了而不是你的口碑变了,而数据里没有任何东西能把两者分开。

“给问题划边界”和“做估计”有什么区别?

估计给出一个点值并藏起它的假设;边界给出一个区间并把假设写出来。划边界只要三句话:写明被估量,也就是你到底想知道的是什么;写明仪器,也就是你实际有的是什么、它测的是什么,包括面板、引擎和日期范围;写明证伪条件,也就是什么样的观察会显示这次解读是错的。“在我们 60 条 prompt 的面板上,7 月里五个引擎中有四个在 28–36% 的答案中点名了我们,每个引擎 200 次观测;我们不知道这些问题被问的频率,所以这不是市场份额”,这句话没法被断章取义,而这正是全部好处所在。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

给测不了的东西划出边界。
剩下的才可信。

免费试用