首页/学习 GEO/站得住脚的报告
衡量 AI 可见度 · 汇报

一份站得住脚的 AI 可见性报告都包含什么?

每个数字都要带上它的观测数、日期范围和面板版本,否则它跟任何东西都没法比。而对照组,是把“你的工作的效应”与“它底下平台的漂移”分开的那样东西。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

一份站得住脚的 AI 可见性报告,会按引擎分别给出提及率与引用率,各自带置信区间,并且每一个都盖上它的观测数、日期范围与面板版本。它还会带一组没人动过的对照 prompt,好让平台漂移与你自己工作的效应保持可分。按引擎分开报并不是龟毛:SIGIR 2026 上一项 11,500 条查询的研究测得,Google 自然结果、AI Overviews 与 Gemini 之间 URL 层面的 Jaccard 相似度只有 0.11 到 0.18,所以一个综合分描述的是一个并不存在的引擎。5

关键要点
  • 有四个戳必须跟着每个数字走:引擎、观测数、日期范围、面板版本。缺任何一个,这个数字就没法和上个月的比。
  • 一组冻结的、十到十五条并且映射面板类别构成的对照 prompt,是把你的效应与引擎漂移分开的那样东西。
  • 这些不要写进页面:任何跨引擎的平均值、小于你可检测效应的变动箭头,以及由引用推算出的流量或收入。
出处信息

每个数字必须带着什么一起出现?

有四样东西必须跟着每个数字一起出现,否则这个数字跟任何东西都没法比:它来自哪个引擎、它背后有多少次观测、它覆盖的日期范围,以及产出它的 prompt 面板版本。缺了其中任何一样,它就不是一次测量,因为读者无法判断这个月的值和上个月的值是不是出自同一台仪器。

面板版本是团队最常跳过的一样,也是最容易悄悄作废掉一整年历史的一样。加进六条 prompt,会改变页面上每一个比率的分母,所以两个版本之间从 29% 涨到 34%,可能只是“问了哪些问题”造成的人为结果。请用两段式版本号,并把它印在每个数字旁边。小版本加一,指只是措辞修订、没有改变 prompt 所问的内容;跨小版本比较可以,加个脚注即可。大版本加一,指有 prompt 被增加、删除或改变了范围;这时不比较,而是重新取基线。把 prompt 清单纳入版本管理,好让任何人都能对两个版本做 diff。

由此推出一条排期规则:绝不要在你想测量的内容或站外工作上线的同一周期里改动面板。一旦这么做,两个原因就被混淆了,事后再多分析也分不开。请在一个平静的周期里改面板、重新取基线,然后再动手。

置信区间也属于该跟着数字走的东西。2026 年那篇批判性综述给出的“GEO 研究最低清单”要求记录:产品、模式、模型、日期与地区,是否启用了搜索,在多个时间窗口重复运行,把检索与生成分开,并把空结果留在分母里。1 一份满足这份研究清单的商业报告,无非就是一份你公司之外的人也能核查的报告。

对照

什么是对照组,报告为什么需要它?

对照组是你 prompt 面板中被刻意“永不动它”的一部分:不为它写内容、不为它做站外工作、看起来难看时也不把它删掉。保留它,是为了让引擎层面的整体漂移与你工作的效应分开显现。没有它,在仪表盘上,“上涨”和“平台更新”看起来一模一样,“下跌”和“运气不好的一个月”也一样。

建一次,在面板创建时。十到十五条就够,而且它们必须映射面板其余部分的类别构成:不同类别的漂移速率不同,所以一个全由定义类问题构成的对照组,追不上一次只打到对比类问题的变化。把它和其他内容一起冻结进同一套版本方案,并标记得足够醒目,好让新同事不会不小心为它做优化。

用“双重差分”的方式读它。你的效应大约等于“优化组的变化”减去“对照组的变化”。如果两边都跌了八个百分点,那是引擎动了,你没做错什么。如果优化组涨了九个点而对照组持平,你手上就有证据了。正是这个减法,把一个前后对比的数字变成一条关于你自己工作的主张。

两条诚实的限制。十来条 prompt 的对照组,自己就带着很宽的区间,所以请把它的变动当作方向而不是精确修正:用一个有噪声的数字去减另一个有噪声的数字,不会得到一个干净的数字;而且这种合并比较所需的数据比任何单边都多,其算术见《统计功效》。以及,它只能控制那些对两组同等生效的变化:它能抓住一次模型更换,抓不住一场恰好瞄准你正在优化的那些问题的竞品攻势。

之所以值得为这一切付出代价,是因为这个领域的平台漂移很大。2026 年那篇批判性综述把“商业引擎彼此不同且随时间变化”评为置信度。1 一份厂商时间序列让这个量级变得具体:从 2025 年 7 月采样的 190 万条 AI Overview 引用,到 2026 年 3 月覆盖 86.3 万个关键词结果页的 400 万个被引 URL,被引页面中同时排进自然结果前十的比例从约 76% 降到了约 38%。6 一个横跨那个窗口做前后对比、又没有对照组的团队,测到的会是平台,而写下来的会是自己的成绩。

页面本身

哪些该写进页面,哪些不该?

有五样东西该写进页面,五样是有害的;分界线在于:这一项能不能经得起一个没跑过这个面板的人的追问。

要写进去

  • 按引擎分的提及率与引用率,各自带置信区间和观测数
  • 优化组与对照组并排,让漂移和效应一眼可分
  • 按 prompt 类别的拆分,因为一类的涨和另一类的跌会在总数里相互抵消
  • 整个面板的被引 URL 排行榜,包括每一个竞品和第三方
  • 两三条答案原文,其中至少一条把你描述错了

不要写进去

  • 任何跨引擎取平均的单一数字
  • 在小于你可检测效应的变动上画箭头
  • 把截图当作证据而不是插图
  • 由引用推算出的会话量或商机
  • 因为你没出现就被悄悄丢掉的那些运行记录

有两项需要把理由说出来。答案原文里那条“说错了的”之所以该上页面,是因为“是否出现”类指标会把一句自信而错误的产品描述记成胜利,而这类描述的基础发生率并不低:哥伦比亚大学 Tow 数字新闻中心 2025 年 3 月 6 日发布的、覆盖八个引擎 1,600 条查询的审计发现,它们“对超过 60% 的查询给出了错误答案”。2 一句被引用的原话,比任何图表都更能让一次修复拿到预算。

收入那一行之所以不该上页面,是因为那个系数并不存在。该领域自己的综述把“引用分数预测点击、转化或收入”评为极低置信度,1 而皮尤研究中心 2025 年 7 月的浏览行为研究发现,用户在约 1% 的访问中点击了 AI 摘要内的链接。3 如果管理层需要一个商业口径,请把建模假设明说出来,并标明它是假设。它一旦变成图表,就会被当成测量结果引用。

按引擎分

报告为什么不能跨引擎取平均?

因为这些引擎看的根本不是同一个网络。SIGIR 2026 上一项研究比较了 Google 自然搜索、AI Overviews 与 Gemini Flash 2.5 对 11,500 条查询返回的来源,测得 URL 层面的 Jaccard 相似度为:AI Overviews 与自然结果之间 0.18,自然结果与 Gemini 之间 0.16,AI Overviews 与 Gemini 之间 0.11。原文写道:“无论取哪个查询子集、比较哪一对搜索引擎,检索到的列表都是不相似的,尽管这三者都由 Google 开发。”5 同一家厂商的三个界面就已经彼此不一致。

综合分于是把读者最需要的东西藏了起来。假设你在一个引擎上是 41%、在另一个上是 9%,那么 25% 这个平均值对哪个引擎都不成立;它会在你改动权重时变动,而不是在你的可见性变动时变动。2026 年那篇批判性综述从审计文献出发得到同一个结论,指出商业引擎之间存在“来源重合度低、跑与跑之间波动大、以及持续存在的保真度缺口”。1

请改成一张小表:每个引擎一行,各自带自己的观测数、置信区间和面板版本。如果管理层想要一个可追踪的单一数字,那就让它是某一个被点名的引擎,并用一句话说明为什么在商业上是这个引擎最要紧。

节奏

这份报告到底该多久发一次?

数字按月发布,面板按周运行,因为这是两件不同的活。一个每引擎约 200 次观测的周度面板,只能把约 13 到 14 个百分点的变动与噪声区分开;而把同样的运行按月聚合,这个门槛会降到约 6.6 个百分点,而几乎所有真实变化都落在这两个数字之间。

周度那一读是定性的,而且确实有用。请读答案而不是读比率,并盯三样东西:引用清单里开始出现的某个竞品或第三方 URL、上周还不存在的一句关于你产品的错误陈述,以及某条 prompt 干脆不再返回 AI 答案了。每一样都是事件而不是比率,所以都不需要统计功效。把它们记下来并采取行动;算术留给月度那一页。

每季度再拿着业务重读一遍面板:prompt 会老化,一个从不退休任何东西的面板,会慢慢变成在测一个没人再问的问题。这属于大版本变更,也就意味着要重新取基线,所以请有计划地安排它。

空结果

什么都没动的时候,报告该怎么写?

它该写“未检测到变化”,并在旁边印出本来能被检测到的变化幅度。“该引擎提及率 31%,200 次观测,相对上月 29% 未检测到变化;本面板可检测的最小变化约为 13 个百分点”,这准确告诉读者哪些东西被弄清楚了、哪些没有。而“上升 2 个百分点”告诉他们的是假的。

有两个习惯能保护空结果不被“收拾干净”。把每一次运行都留在分母里,包括那些你根本没出现的:2026 年那篇批判性综述的清单对此有明确要求,而悄悄丢掉空白运行,是一个面板开始讨好自己主人的最常见方式。1 以及,报区间而不是报点估计。2026 年 3 月那篇 AI 可见性测量的统计学论文发现,引用计数呈幂律形状,且排名“在重复采样之间不稳定,不只是排在最前面的域名,而是整个高频被引域名集合都如此”,该文用 bootstrap 重采样来报告这种不确定性。4 当比率很低或很高时,正态近似会退化,所以那里该用精确区间或 bootstrap 区间;不过这一条属于普通统计学常识,并不是那篇论文的发现。

请把“没有变化”当成常态:NeurIPS 2025 的 C-SEO Bench 发现,“当前多数 C-SEO 方法不仅在很大程度上无效,还经常对文档排序产生负面影响”。7 即便如此,一个数字没动的月份,也很少是一个没什么可报的月份。你的比率没变,引用清单也会变,而行动就在那里:谁的页面顶替了谁、你自己的哪些页面从来不出现,以及哪些答案现在开始说了关于你的不实之词。一份价值取决于比率上涨的报告,最终会被写成让比率上涨的样子。

本文的诚实边界

这里描述的对照组设计,在这个场景下没有被验证过,而且也不容易被验证。双重差分比较假设“如果你什么都不做,两组会平行漂移”,而没有任何已发表的研究检验过 AI 回答引擎是否真的会在不同 prompt 类别之间平行漂移。唯一相关的那次测量,对引用计数做了连续九天的观察,发现的是整个高频被引集合内部的不稳定,而不是一条共同趋势。所以对照组能可靠地告诉你“发生了平台层面的事”;它给不了你一个干净的数值修正,因此报告应当把两组并排呈现,而不是把那个减法当作单一的“已校正数字”发布出去。本页其余内容都是纪律而非发现:出处标记让一份报告可被核查,而“可核查”与“正确”并不是一回事。

产品在哪里派得上用场,在哪里派不上

这份报告说到底是一张电子表格,外加一个“在里面保持诚实”的决定。给 prompt 清单打上版本号,标出十来条作为对照组并且永不去动它们,给每个数字盖上引擎、观测数、日期与版本,并在确实如此时写下“未检测到变化”。Bavior 按计划把固定 prompt 面板打到五个引擎上,保留每一次运行(包括空白的那些),记录每一个被引用的 URL(包括不属于你的那些),并按引擎分别汇报。它不做的事情是:替你决定哪些 prompt 属于对照组、替你保证没人去为它们做优化,或由引用推算流量与收入。免费可见性检测免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 30 日)。

出处,全部核查于 2026 年 8 月 30 日
  1. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035;见表 5 与表 6(综述预印本):arxiv.org/abs/2607.14035
  2. Jaźwińska 与 Chandrasekar,哥伦比亚大学 Tow 数字新闻中心,《AI Search Has a Citation Problem》,2025 年 3 月 6 日;跨八个引擎的 1,600 条查询;超过 60% 有误:cjr.org
  3. 皮尤研究中心,2025 年 7 月 22 日;用户在约 1% 的访问中点击了 AI 摘要内的来源:pewresearch.org
  4. Sielinski,《Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement》,2026 年 3 月,arXiv:2603.08924(预印本):arxiv.org/abs/2603.08924
  5. Grossman 等,《How Generative AI Disrupts Search》,SIGIR 2026;11,500 条查询;Google 自然结果、AI Overviews 与 Gemini 之间 URL 层的 Jaccard 为 0.11–0.18:arxiv.org/abs/2604.27790
  6. 某 AI Overview 引用时间序列:2025 年 7 月采样的 100 万条 AI Overviews 中的 190 万条引用,与 2026 年 3 月覆盖 86.3 万个关键词结果页的 400 万个被引 URL 相比;被引页面中同时排进自然结果前十的比例从约 76% 降至约 38%。厂商发布;按本课程的出处规则只描述、不链接。
  7. Puerto 等,《C-SEO Bench: Does Conversational SEO Work?》,NeurIPS 2025 数据集与基准赛道,arXiv:2506.11097:arxiv.org/abs/2506.11097
常见问题

你想知道的,都在这里。

对照组该留多少条 prompt?

十到十五条,并且要按面板其余部分的类别构成来挑。构成比数量更重要:如果你实际优化的 prompt 里有三分之一是对比类问题,对照组里也该有三分之一,因为不同 prompt 类别的漂移速率不同,一个全由定义类问题构成的对照组,追不上一次只打到对比类问题的变化。请在建面板时就把它冻结、和其他内容一起纳入版本管理,并标记得足够醒目,好让新同事不会不小心去为它写内容。它自己的置信区间会很宽,所以请把它的变动当作方向,而不是一个精确的修正量。

面板为什么需要版本号?

因为增删一条 prompt 会改变页面上每一个比率的分母,所以由不同面板版本产出的两个数字并不可比,哪怕它们看起来一模一样。请用两段式版本号:小版本号加一,表示只是措辞修订、没有改变 prompt 所问的内容,跨小版本比较加个脚注即可;大版本号加一,表示有 prompt 被增加、删除或改变了范围,这种情况下不比较,而是重新取基线。把版本号印在每个数字旁边,并把 prompt 清单纳入版本管理,好让任何人都能对两个版本做 diff。另外:绝不要在你想测量的那项工作上线的同一周期里改动面板。

AI 可见性报告该不该包含预估流量?

不该,因为你要乘上去的那个系数从来没有被测量过。该领域自己 2026 年的综述把“引用分数预测点击、转化或收入”评为极低置信度;皮尤研究中心 2025 年 7 月的浏览行为研究发现,用户在约 1% 的访问中点击了 AI 摘要内的来源。如果管理层需要一个商业口径,请把它写成一句点明假设的话,比如“如果约 1% 的读者会点击、而这个问题被问得足够频繁”,而不是写成一张图表,因为一张图表到第二次开会时就会被当成测量结果来引用。

数字没动的时候,报告里该写什么?

写“未检测到变化”,并在旁边印出这个面板本来能检测到的最小变化幅度。“提及率 31%,200 次观测,相对上月 29% 未检测到变化;本面板可检测的最小变化约为 13 个百分点”,这句话准确告诉读者哪些东西被弄清楚了、哪些没有;而“上升 2 个百分点”告诉他们的是假的。然后去报那些确实变了的东西:即使你的比率没动,引用清单也会变,而行动就在那里,比如谁的页面顶替了谁、你自己的哪些页面从来不出现,以及哪些答案现在开始说了关于你的不实之词。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

给每个数字都盖上出处。
然后它才辩护得了。

免费试用