首页/学习 GEO/前 90 天
GEO 项目 · 运营

GEO 项目的前 90 天应该长什么样?

一份带着“你真愿意让它失败”的闸门的排期,顺序由测量本身能支撑什么决定。第一个月买的是仪器,不是结果。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

第一个月几乎只做一件事:把仪器建起来,因为仪器自身的晃动比你想检测的那点变化还大。然后按“每个阶段产出下一个阶段所需输入”的顺序推进,并在阶段之间放上你真愿意让它失败的闸门。温度为零时重复运行会改变 9 到 28% 的判定,四个引擎上逐日的来源级 Jaccard 在 0.34 到 0.42 之间,所以一个季度勉强够把这层噪声刻画出来,谈不上盖过它。1

关键要点
  • 承诺“第 90 天拿出可测量的提升”,等于承诺仪器给不了的东西。一个季度真正能交付的是:一条基线、一层干净的技术底座、一份带日期的变更日志,以及一次诚实的复测。
  • 第 1 到 4 周是布置仪器:prompt、运行次数、记录下来的运行元数据、一个冻结的面板版本,以及一组谁都不去碰的对照组。
  • 四道闸门,每一道都写明失败时怎么办:技术通过、面板冻结、对照组不被触碰,以及一次与基线条件完全一致的复测。
  • 内容工作要等到第 5 周,因为已发表的内容侧效应量都很小、其中几项还是负的;这么小的效应必须待在仪器后面,而不是仪器前面。
测量

为什么第一个月买的是仪器而不是结果?

理由和项目管理惯例没有关系,全部来自“你什么都不动的时候,测量自己会怎么动”。2026 年那篇批判性综述把可复现性的证据集中到了一处。Kirsten 等人(其 4,706 条查询的审计是同行评议成果)发现,在温度为零的条件下重复跑一次,会改变 9 到 28% 的判定。2 Schulte 等人在四个引擎上观察 45 天(一个很小的瑞士查询集合),记录到逐日的来源级 Jaccard 在 0.34 到 0.42 之间。1

把这两条放在一起读。在任意一天里,引擎为你这套 prompt 引用的来源中,有很大一部分和昨天不一样,而你这边什么都没改。这就是任何干预必须盖过的量级,也是为什么基线是一个分布而不是一次读数。分布需要重复才看得见。跑一次单条 prompt,告诉你的关于引擎的信息很少,关于“你跑它的那一分钟”的信息倒是不少。

要多少条 prompt、跑多少次才买得到一个可用的区间,这是算术,算在要多少 prompt 和多少次运行里;给定面板规模能检测到什么、检测不到什么,算在统计功效里。这里都不重复;本文只取它们的结论:报告单位是面板,永远不是单条 prompt。

这对日历的后果,值得对定下这个期限的人说清楚。90 天之内,你可以建立一条你信得过的基线、把修复上线、再把面板重读一次。你没法同时证明某一次内容改动导致了某一段变化,因为拿一次前后对比去对付一台会漂移的仪器,撑不起这个结论。第一周把这话说了,是一场比第十二周再说好得多的对话。

闸门

每个阶段要过哪些闸门?

闸门是一个你真愿意让它失败的条件。如果失败了什么也不会发生,那它就只是个里程碑,而里程碑保护不了任何东西。

闸门时点通过条件不通过怎么办
可检索性第 4 周末范围内每个页面在一次普通抓取里就返回正文,已被收录且可带摘要展示,且你依赖的爬虫令牌没有被禁止停下。不要开始内容工作:引擎抓不到的页面,其余一切也无从测量
面板冻结第 4 周末prompt 清单、每个引擎的运行次数、记录下来的运行元数据都已打上版本,且在第 12 周之前不会变重做基线。中途长大的面板,分母是跟着分子一起动的
对照组第 4 周末有 10 到 15 条 prompt 被标记为“永不干预”,并且做事的人都知道是哪几条可以继续,但要把变化写成“与你的工作同时发生”,而不是“由你的工作导致”
复测第 12 周第 12 周那次运行在产品、模式、模型、地区、账号以及是否开启搜索上,都与第 4 周那次一致把差异写成“未测量”。未测量不等于零

第一道闸门是技术通过,它的具体条目不归本文管:技术 GEO 清单按“跑起来最便宜”的顺序列出了那些条目,而跑它是第 2 周的活。这里要讲的是它为什么排在最前面。Google 的文档写明,要有资格成为支持链接,页面“必须已被收录,并且有资格带摘要出现在 Google 搜索里”7,而它的生成式功能“根植于我们核心的搜索排序与质量系统”。6 一个不满足这些条件的页面,产出的不是一个弱测量,而是没有测量;此后每一次把它算进去的比较,都是在把“不存在”读成“结果”。

第四道闸门看着吹毛求疵,直到它咬人。那篇综述自己的可复现性建议里列出了一次运行必须记录哪些东西,另一次运行才和它可比:“产品、模式、模型、日期、地区、账号,以及是否开启搜索”。1 在第 4 周和第 12 周之间改动其中任意一项,你报告出来的差异就悄悄把它也包含进去了。第 1 周把它们写下来不花什么成本;到第 12 周再去还原,则根本做不到。

排期

每一段周次分别产出什么?

顺序的依据是:每个阶段产出下一个阶段所需的输入。产出才是真正的规格说明,活动只是抵达那里的方式。

01

第 1–2 周 · 架仪器

prompt 要从真实的通话、工单和丢单记录里写出来,不要从关键词工具里抄,然后按计划跑它们。产出:每个引擎一条带区间的基线,以及这些引擎实际引用过的 URL 清单。

02

第 2 周 · 体检

技术清单和基线并行跑,不要等基线跑完再跑。它是一次只读的检查,不会扰动下面正在进行的测量。产出:一份修复清单,其中大部分是一个迭代的量。

03

第 3–4 周 · 修复并冻结

把技术修复上线,然后给面板打版本、指定对照组。产出:一个可检索的站点,以及一台不会再因为你的动作而移动的仪器。

04

第 5–8 周 · 站内

把意图最强的那批页面改写成“段落式”:问句标题、答案放在头两句、数字带着分母。产出:这些页面在选择阶段也有资格,而不是只在检索阶段有。

05

第 7–12 周 · 站外

纠正第三方页面上关于你的错误事实,让实体描述保持一致,去回答引擎已经在引用的那些讨论帖。产出:被引用的 URL 组成发生变化,而且来得比谁都希望的要晚。

06

第 12 周 · 复测

重跑那个冻结的面板,把被干预的 prompt 与对照组并排放,然后无论结果朝哪个方向都把它写下来。产出:一份站得住脚的前后对比,或者一个诚实的零结果。

内容排在第 5 周而不是第 1 周,除了“基线还没有”之外还有第二个理由:已发表的内容侧效应量都很小,其中几项还是负的。C-SEO Bench 是 NeurIPS 2025 的一个基准,覆盖十种方法、两类任务、六个领域,它报告说当前多数方法“不仅基本无效,还常常对文档排名产生负面影响”,并且在 54 个受测案例中只有 3 个出现了统计显著的排名改善。4 KDD 2026 上的 SAGEO Arena 把检索与重排重新放了回来,而不是直接给模型一段固定上下文,它发现只优化正文会把三个总体均值从 0.58、1.00、0.50 拉到 0.53、0.84、0.47,即分别朝反方向走了 9%、16% 和 6%。5 预期效应这么小的工作,必须待在仪器后面。

承诺

到第 90 天你能诚实承诺什么?

四件交付物,没有一件是“某个数字涨了”。一个打了版本的 prompt 面板,附每个引擎的基线与区间。一层能通过抓取级体检的技术底座。一份带日期的变更日志,好让下个季度能做归因而不是靠猜。以及一次把对照组并排放着的面板复测。这份清单能在一屋子怀疑的人面前站住,它也就是一个季度诚实买到的东西。

你不能承诺的,恰恰是你会被要求的那些:某个排名、出现在某条具体的答案里,或者收入。那篇综述的置信度表把“引用得分能预测点击、转化或收入”评为极低1 流量那一端也很弱。Pew 在 2025 年 3 月追踪了 900 名美国成年人的 68,879 次 Google 搜索,发现点击 AI 摘要里某个来源的情况“只发生在全部访问的 1%”。8 一个被当作流量项目卖出去的可见性项目,最后会按它从来没在测的指标被审判。

对这份承诺还有一条限制,它是算术而不是判断。如果你的面板只能分辨大约十个点的变化,而你上线的改动值三个点,那么第 12 周的复测就什么也看不到;这是仪器的属性,不是关于这份工作的证据。请在第 1 周就决定“多大的变化会改变一个决策”,拿它去对照统计功效;如果面板看不见这么小的变化,要么把面板做大,要么别再承诺能检测到它。

失效方式

哪些排序错误会葬送整个季度?

有一支把季度顺序做反了的团队,可以把这种失败讲具体。他们一上来就是六周的内容冲刺,因为内容是所有人都已经会做的那部分;第 7 周才开始测量;到第 12 周手里有一条上扬的线,却没有办法为它辩护。页面在任何人记录“引擎看到的是什么”之前就已经改了,于是那个“之前”只存在于记忆里。面板随着新问题冒出来,从 22 条 prompt 长到了 60 条,于是分母跟着分子一起动。而且没有对照组,所以一次把所有东西都抬起来的平台侧变化,看上去和“冲刺奏效了”一模一样。他们做的每一件事本身都不坏。是顺序把它作废了。

经得起复盘的排序

  • 在范围内任何页面被改动之前,先取基线
  • 一个季度只有一个面板版本,并写进报告里
  • 一组 10 到 15 条、谁都不碰的对照 prompt
  • 一个时间窗只动一个变量:先技术,再站内,再站外
  • 按引擎分别给数,每个数都带自己的区间

会让结果作废的排序

  • 第 1 到 4 周搞内容冲刺
  • 想到什么问题就往面板里加 prompt
  • 技术修复和内容改动在同一周上线
  • 把各引擎平均成一个混合分数
  • 把单次运行读成关于引擎的事实

“混合分数”这一条能上榜,靠的是测量而不是口味。SIGIR 2026 上一项覆盖 11,500 条代表性查询的研究测得,Google 自然结果、AI Overviews 与 Gemini 之间 URL 层面的 Jaccard 相似度为 0.11 到 0.18。3 Jaccard 是交集除以并集,不是“被引用 URL 的占比”;在这个水平上,这三个面几乎是不相交的。把它们平均出来的那个数,描述的不是任何一个人真能去访问的引擎。

交接

第 91 天会发生什么?

计划结束,节奏开始,这两者形状不同。这 90 天存在的意义,是造出一样此后可以用一小部分注意力长期跑下去的东西:一个按计划自动跑的面板、一份每个月列名都相同的报告,以及一个永远清不完的站外队列。周期性的节奏归站外每周工作流管,报告的形状和对照组比较归一份站得住脚的报告管,长期账单归跑 GEO 要花多少钱管。本文在交接处停下。

有一样东西确实会越过这条边界。闸门并不在第 90 天退休,它们变成之后每一次比较的常设条件。一个重做基线、扩大面板,或者弄丢了对照组的季度,无论日历怎么写,都是从这份计划的第一周重新开始。

本文的诚实边界

这里的排序论证依据的是关于“不稳定性”的证据,而不是“这个顺序优于另一个顺序”的证据。没人做过那个实验,也很难看出怎么做:对照条件需要同一个站点的第二份拷贝。两个不稳定性数字都来自很窄的样本,一个是 45 天的小型瑞士查询集合,一个是 4,706 条查询的审计,而且都是经由一篇综述转述,而不是被独立复现过。证据确实确立的是:测量自己就会显著移动,这已经足以排除“在一个季度内承诺可测量的提升”。但它不足以宣称这些具体的周次边界是最优的。请把它们当作一个站得住脚的默认值,等你自己的基线说了别的,再去挪动它们。

产品在哪里派得上用场,在哪里派不上

这份计划里大部分是日历纪律,而没人卖这个。prompt 来自你自己的通话和工单,技术修复是你工程师的活,冻结和对照组则是必须有人做出、并且守住的决定。没有任何工具能强制执行这些。工具能干的是中间那段重复劳动:Bavior 按计划把一组固定的 prompt 面板打到五个引擎上,记录每条答案引用了哪些来源,并保留让第 12 周与第 4 周可比所需的运行元数据;当被引用的来源是一条活跃的讨论帖时,它会用你掌控的账号起草回复,在任何内容发出之前由你审批。它不会替你写 prompt 面板,不会替你决定何时冻结,无法让一个不可检索的页面变得可检索,也没法把这 90 天缩短。免费 AI 可见性检测免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 30 日)。

出处,全部核查于 2026 年 8 月 30 日
  1. 《A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035;9–28% 的重复判定变化(Kirsten 等)、逐日来源级 Jaccard 0.34–0.42(Schulte 等,四个引擎、45 天、一个很小的瑞士查询集合)、可复现性字段与表 5(预印本):arxiv.org/abs/2607.14035
  2. Kirsten 等,《Characterizing Web Search in The Age of Generative AI》,Findings of ACL 2026;4,706 条查询,美国与德国,2025 年 9 月:aclanthology.org/2026.findings-acl.526
  3. Grossman 等,SIGIR 2026;11,500 条代表性查询;URL 层面的 Jaccard 为 0.11–0.18:arxiv.org/abs/2604.27790
  4. Puerto、Gubri、Green、Oh、Yun,《C-SEO Bench: Does Conversational SEO Work?》,NeurIPS 2025 数据集与基准赛道,arXiv:2506.11097:arxiv.org/abs/2506.11097
  5. 《SAGEO Arena》,KDD 2026,arXiv:2602.12187v2;表 2,仅优化正文的均值与基线对比:arxiv.org/abs/2602.12187
  6. Google Search Central,《Google’s Guide to Optimizing for Generative AI Features on Google Search》,最后更新于 2026 年 7 月 10 日(“根植于”一句;第一方文档):developers.google.com/search/docs/fundamentals/ai-optimization-guide
  7. Google Search Central,《AI features and your website》,最后更新于 2025 年 12 月 10 日(已被收录且可带摘要展示;第一方文档):developers.google.com/search/docs/appearance/ai-features
  8. Pew Research Center,《Google users are less likely to click on links when an AI summary appears in the results》,2025 年 7 月 22 日;900 名美国成年人、68,879 次搜索,2025 年 3 月:pewresearch.org
常见问题

你想知道的,都在这里。

一个 GEO 项目能在 90 天内证明可测量的提升吗?

很少能,承诺这件事的方案是在高估仪器。温度为零时重复运行会改变 9 到 28% 的判定,四个引擎上逐日的来源级 Jaccard 在 0.34 到 0.42 之间,所以一个季度大致就只够刻画这种漂移、外加把面板重读一次。请改为承诺一份可信的基线、一层干净的技术底座,以及一次诚实的复测。

为什么第一个月里没有内容工作?

因为页面在基线采集之前就变了,会毁掉之后的每一次比较:那个“之前”从此只存在于记忆里。还有第二个理由。已发表的内容侧效应都很小,而且常常是负的,C-SEO Bench 在 54 个受测案例里只有 3 个出现显著的排名改善;这么小的效应,在仪器还没跑起来的时候根本读不出来。

为什么 prompt 面板必须冻结到第 12 周?

因为一个在季度中途长大的面板,分母是跟着分子一起动的,第 12 周那条序列于是和第 4 周的那条不可比。请在第 4 周结束时把 prompt 清单、每个引擎的运行次数和记录下来的运行条件冻结并打上版本号,把新冒出来的问题放进下一个季度的面板,而不是这一个。

如果到第 90 天什么都没动,该怎么汇报?

就汇报这个零结果,并把面板版本、观测数和置信区间一并写在旁边,同时说明这个面板本来能检测出多大的变化。一台只能分辨十个点的仪器给出一条平线,并不等于三个点的变化失败了,它只说明面板看不见它。这个区分,就是一份报告和一个故事之间的差别。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

第一个月买的是仪器。
先把它架起来,再动手修。

免费试用