首页/学习 GEO/该承诺什么
GEO 项目 · 预期管理

关于 AI 可见度,你能诚实地向 CEO 承诺什么?

这项工作能测到的东西,和一位高管希望被承诺的东西,中间的落差就是 GEO 项目被砍掉的地方。本文给出弥合这道落差又不过度承诺的措辞,以及必须点名拒绝的五个请求。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

承诺“在一组明确定义的问题面板上被提及的份额”,承诺你重新测量它的节奏,然后拒绝这之后的一切。有两项已发表的发现决定了这条线画在哪里:这个领域自己 2026 年的批判性综述,把“引用分数能预测点击、转化或收入”评为极低置信度,是其评级中最低的一档1;而 Pew Research Center 对 900 名美国成年人的面板记录到,在带 Google AI 摘要的页面访问里,点击摘要内部来源的情况“只占全部访问的 1%”。2

关键要点
  • 能活过第四个月的承诺,是一个基线、一套节奏,以及在一组公开面板上提及份额与引用份额的变化。绝不是名次、日期或成交数量。
  • 每一个被承诺的数字都要带上区间。跑 5 次时,95% 区间大约是上下各 33 个百分点,所以一个来自 5 次运行的头条比例,承诺不了任何站得住的东西。
  • 点名拒绝五个请求:名次、出现在某个特定答案里、一个百分比提升、一份出结果的时间表,以及把收入归因到一次引用。
  • 用替换来说不:先说清你给不了哪个数字,用一句话说明原因,再把你能站得住的最接近的数字连同运行记录一起交出去。
措辞

什么样的承诺能扛过季度复盘?

写出来是四句话,短到可以在会上直接说:“两周之内你会拿到一个基线,也就是在一组固定的、你的买家真正会问的问题面板上,每个引擎点到我们名字的频率有多高,按引擎分别报告,并附上误差范围。此后每个月你都会看到同一组面板被重跑一遍,面板和运行记录都公开。我们会努力抬高其中的提及份额与引用份额,而无论走势往哪边去,两个读数你都会看到。我们不会承诺名次、不会承诺出现在某个特定答案里、不会承诺百分比提升、不会承诺日期,也不会承诺收入数字。”

这四句话各自站得住的理由并不相同。基线站得住,是因为它是你自己做出的一次观测,而不是关于世界的一项主张。固定面板站得住,是因为它自带分母:它是“你选定的那些问题”里的一个份额,这是一个真实的分数;而没有任何引擎公布 prompt 的提问量,因此谁也无法诚实地说出“品类份额”。节奏站得住,是因为那是你能掌控的工作,而不是你掌控不了的结果。而最后那句拒绝站得住,是因为 2026 年那篇批判性综述在梳理 45 项研究后得出的结论是:“所审阅的技术中,没有任何一项显示出对自然可发现性或下游行为具有稳定的、纵向的、跨平台的因果效应。”1

请读一读它的形状。三句话承诺的是仪器和节拍,一句承诺了一个方向,并写明了不确定性。这比这一类方案通常给出的东西都要小,而当第一个走平的季度到来时,它是唯一还立着的那个版本。

拒绝清单

无论压力多大,哪些东西永远不能承诺?

其中五条几乎每次启动会都会被问到,第六条则会在引擎第一次把产品说错时到来。在别人替你把它们许出去之前,先当众点名拒绝。

01

一个名次

生成出来的答案里并没有一份可供你去占位的排名榜。Google 把自己的 AI 界面称为“根植于我们核心的搜索排序与质量系统”3;而一项 4,706 条查询的审计发现,AI Overviews 查阅过的域名中有 53% 位于自然结果前十之外。4

02

出现在某个特定答案里

在温度为零的条件下重复运行,会改变引擎 9% 到 28% 的决定;而跨两个月的页面重合度,AI Overviews 为 18%,Google 自然结果为 45%。1 单条答案是一次抽取,不是一个位置。

03

一个百分比提升

NeurIPS 2025 的一项基准测试评估了十种对话式 SEO 方法,原文写道:“在 54 个案例中,我们只找到 3 个排名改善在统计上显著。”5 KDD 2026 的一个竞技场式评测则发现,十种正文类策略的平均表现等于或低于基线。6

04

一个出结果的日期

没有任何已发表的工作确立了白帽改动的“见效时间”,而这个界面本身就是断续出现的:AI Overviews 在 55,393 条趋势查询上的触发率为 13.7%,在问句形式的查询上是 64.7%。7

05

收入,或者流量

2026 年那篇综述把“引用分数能预测点击、转化或收入”评为极低置信度,并注明因果关系并未确立。1 在通常情况下点击根本不会发生,于是分析后台没有事件可记录。2

06

答案本身是对的

你可以监控一个产品是怎么被描述的,也可以去修它背后的来源;但你无法承诺那段描述。Tow Center 发现,八个引擎在 1,600 条查询上有超过 60% 回答有误,最差的一个是 94%。8

有一个数字值得直接点名,因为房间里总会有人读到过它。那篇综述自己的置信度表把“GEO 增加 40% 的可见度”列为作为一般性主张被驳回:这个数字是特定配置下、单一指标上的一个相对最大值。1 你为了拿预算而复述它,就等于递给你的 CEO 一个对手一次检索就能拆掉的数字。

不确定性

为什么每个被承诺的数字都要附上区间?

因为不带区间的比例,承诺的是噪声。本课程统一使用的算法是 p 取 0.5 时的 95% Wilson 半宽:1.96 除以(n 加 3.84 后再开平方,然后乘二)。跑 5 次约为 ±33 个百分点,30 次约 ±17,200 次约 ±7。所以“我们在五条答案里被点到三次”是 60%,其可信范围大约从四分之一一直到十分之九;而“把它提到 80%”这个承诺,承诺的是一个当下根本看不见的变化。样本量的算术另有一页专门推导。

区间改变的是你说出口的那句话,而不是你做的工作。“在我们的面板上,我们出现在 60% 的答案里,每条 prompt 跑 5 次时上下各 33 个百分点;如果你要把这个误差压到十个百分点以内,我需要每条 prompt 跑大约一百次,成本是这些。”它把“你有多乐观”的争论,换成了“要买多少检测力”的决策,而后者恰恰是高管真正有能力拍板的事。

它也在反方向上保护你。在读数下滑之前就附上的区间,才分得开波动与失败叙事;事后再补,读起来就是它本来的样子。

如何说不

怎样拒绝一个指标请求,又不显得在闪躲?

没有替代物的拒绝才显得像闪躲。先说清你给不了哪个数字,用一句话说明理由,再把你能站得住的最接近的数字交出去。

会被问到什么为什么它不能被承诺该怎么当场回答
你能把我们做到 ChatGPT 里的第一名吗?生成出来的答案里没有一份排名榜“那里面没有第一名可以拿。我能承诺的是:在我们买家的问题所产生的答案里,我们占到的份额是多少,按引擎分开,并且每一次运行都给你看。”
能提升多少?什么时候?54 个受测案例里只有 3 个显著;也没有任何公开的见效时间“我不会给你一个百分比,也不会给你一个日期。我会在两周内给你一个带误差范围的基线,以及每个月对同一组面板的重跑。”
这能带来多少商机?被评为极低置信度;点击通常根本不会发生“我无法把商机归因到这件事上,任何愿意这么做的人都是在建模而不是在测量。我能告诉你的是:在决策发生的地方,我们被点到名的频率有多高。”
周一有客户问起时,我们会出现吗?即使温度为零,运行之间也不稳定“任何单独一条答案都不能保证。跑一百次,我可以给你一个带区间的比例,那是同一个问题的诚实版本。”

有两个习惯决定了这套做法读起来是严谨还是推诿。把这些拒绝放在启动会上主动说出来,那时它们不花你任何代价;而不是留到复盘会,那时它们看起来像是后退。给每一个“不”都附上一个选项和一个价格:“在这个样本量下不行,而更大的样本量成本是这些”是一份提案,而单独一句“那没法知道”只是一次耸肩。

然后在所有地方保持同一套措辞:同样那四句话,出现在启动会材料、董事会更新、月度报告以及你签的任何供应商合同里。一个在提案和报告之间换了语气的承诺,就是会被读成粉饰的那一个。

写进文件

哪些句子可以安全地写进书面承诺?

五样东西,外加一条排除条款。把 prompt 面板放进附录,让分母可被检视;写明是哪些引擎、每个引擎以什么模式被查询;写明每个数字背后的运行次数与区间;并且把测量条件写进正文而不是脚注:那篇综述给研究开出的最低清单要求列出“产品、模式、模型、日期、地区、账号,以及是否启用搜索”。1 一个在一组条件下测量、却在另一组条件下汇报的承诺,已经不是同一个承诺了。哪些指标经得起推敲是另一个问题。

排除条款是人们最容易跳过、却真正能救下项目的那一部分。把拒绝当作拒绝写下来:“本项目不承诺名次,不承诺出现在任何特定答案中,不承诺百分比改善,不承诺某个变化在哪一天变得可见,也不承诺可归因于一次引用的收入。”这句话在启动时不花任何成本,却会在气氛转向时成为所有人回头去翻的那份文件。

再加一条重设基线的条款。引擎会在测量脚下发生变化,而那篇综述把“各商用引擎彼此不同,且随时间变化”评为高置信度。1 请事先写明:当模型版本、模式或界面发生变化时,基线重置、比较重新开始。

过度承诺的代价

一个过度承诺的项目,在第四个月是什么样子?

它看起来像是一次因为错误理由而发生的撤销。有个团队在第五个月接手了这样一个项目,发现最初的方案承诺了 40% 的可见度改善和一部分“由此带来的商机”,而支撑它的面板只有 8 条 prompt、每条各跑一次。把那组面板重跑之后,提及率其实是上升的,从大约 25% 涨到大约 38%;但在 8 次运行下,每个读数的区间大约是 ±30 个百分点,所以诚实的读法是:两个方向上都没有发生任何可测量的事。项目还是被砍掉了,砍在一个它本来就不该做出的承诺上。

对照的那个案例更乏味,却活了下来。有个团队只承诺了一组面板、一套节奏和一个区间;第二个月走平,他们用一行字说明了这件事,然后继续做下去,因为“走平的一个月”本来就写在那位高管批准过的计划里。它的打法并没有更好。是真正到来的那个数字,落在了它事先描述过的范围之内。

这就是“更小的承诺”的商业理由。过度承诺只是把耐心提前花掉,而账单恰好在测量终于变得足够灵敏、能看出点东西的时候寄到。

本文的诚实边界

“更小的承诺”这一主张,依赖的是证据的缺席,而证据缺席并不等于缺席的证明。“引用分数尚未被证明能预测收入”,并不意味着引用带不来收入;它意味着能够确立这件事的那项研究还没有被做过。那个 1% 的点击数字描述的是 2025 年 3 月一个美国面板看到的 Google AI 摘要,不是 ChatGPT 或 Perplexity,也不是这个季度;而与它并列的那篇综述是预印本。本文没有说 AI 可见度不值得投入。它说的是:上面那几条具体的承诺,用现有已发表的东西撑不住。

产品在哪里派得上用场,在哪里派不上

这些事一样软件都不需要:一组固定面板、一张表格、一个写明的区间,再加一个愿意在会上说“不”的人,整件事就做完了。Bavior 按计划把一组固定的 prompt 面板打到五个引擎上,按引擎分别报告并附上运行记录,还会记录每一个被引用的 URL,好让“声量份额”有一个你能查验的分母。而 Bavior 不能承诺的,正是你不能承诺的那些:它不出售名次,无法把一个品牌塞进任何特定答案里,不预测由引用带来的流量或收入,也不会给你一个日期。免费 AI 可见性检测免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(核对于 2026 年 8 月 30 日)。

出处,全部核查于 2026 年 8 月 30 日
  1. Martinez,《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(预印本;表 5 与表 6,以及转述自 Kirsten 等人的重复运行与两月重合度数据):arxiv.org/abs/2607.14035
  2. Pew Research Center,《Google users are less likely to click on links when an AI summary appears in the results》,2025 年 7 月 22 日;900 名美国成年人、68,879 次 Google 搜索,数据采集于 2025 年 3 月:pewresearch.org
  3. Google Search Central,《Google’s Guide to Optimizing for Generative AI Features on Google Search》,更新于 2026 年 7 月 10 日(第一方文档):developers.google.com/search/docs/fundamentals/ai-optimization-guide
  4. Kirsten 等,Findings of ACL 2026;对 Google AI Overviews 的 4,706 条查询审计,数据采集于 2025 年 9 月,覆盖美国与德国:aclanthology.org/2026.findings-acl.526
  5. Puerto、Gubri、Green、Oh、Yun,《C-SEO Bench: Does Conversational SEO Work?》,NeurIPS 2025 数据集与基准赛道,arXiv:2506.11097:arxiv.org/abs/2506.11097
  6. Kim 等,《SAGEO Arena: A Realistic Environment for Evaluating Search-Augmented Generative Engine Optimization》,KDD 2026(arXiv:2602.12187v2,2026 年 8 月 7 日):arxiv.org/abs/2602.12187
  7. Xu、Iqbal 与 Montgomery,2026;55,393 条趋势查询,采集于 2026 年 3 月 13 日至 4 月 21 日;AI Overview 整体触发率 13.7%,问句形式查询为 64.7%(预印本):arxiv.org/abs/2605.14021
  8. Jaźwińska 与 Chandrasekar,《AI Search Has a Citation Problem》,哥伦比亚大学 Tow 数字新闻中心,2025 年 3 月 6 日;八个引擎、1,600 条查询:cjr.org
常见问题

你想知道的,都在这里。

我能不能向 CEO 承诺一个 AI 可见度的提升百分比?

不能,而且反对它的证据来自这个领域自己。NeurIPS 2025 的一项基准测试评估了十种对话式 SEO 方法,54 个受测案例里只有 3 个的排名改善在统计上显著;KDD 2026 的一个竞技场式评测则发现,正文类策略的平均表现等于或低于基线。请改为承诺一个带误差范围的基线,以及每月对同一组面板的重跑,让走势被报告出来,而不是被预测出来。

CEO 问这件事能带来多少商机时,我该怎么说?

就说你无法把商机归因到它上面,任何声称能做到的人都是在建模而不是在测量,然后把你确实有的数字给他。2026 年那篇批判性综述把“引用分数能预测点击、转化或收入”这一主张评为置信度极低,是其评级中最低的一档。Pew 记录到,在带 Google AI 摘要的页面访问里,点击摘要内部来源的情况只占 1%,也就是说分析后台需要的那个事件多数时候根本不存在。

把“声量份额”作为承诺是安全的吗?

只有在附带三样东西时才安全:它是在哪组面板上测的、对照的是哪几个竞品、以及它的区间。固定面板上的声量份额是一个真实的分数,因为分母是你自己选的、也可以公开。可是“品类内的声量份额”不是,因为没有引擎公布 prompt 的提问量,谁都无法诚实地构造那个分母。把面板写进句子里,这个说法才站得住脚。

拒绝承诺结果,会不会让项目更难拿到预算?

它会让第一次对话更难,让第四次对话变得可以活下来。项目很少因为某个数字走平而被砍掉;它们被砍掉,通常是因为一个谁也没承诺过的数字没有达成。一条写明五项拒绝的书面排除条款在启动时不花任何成本,却会在气氛转向时成为所有人回头去翻的那份文件,所以它属于方案本身,而不属于事后的更正。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

更小的那个承诺,才是最后还站得住的。
先拿到一个带误差范围的基线。

免费试用