首页/学习 GEO/检查清单
技术 GEO · 综合

技术 GEO 检查清单,按你该跑的顺序排好。

三层共十项检查。每一项都写明跑什么、通过和失败各长什么样,以及失败后该读哪一篇。顺序不是装饰:这些项目彼此并不独立。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

技术检查清单是三层共十项检查,按“便宜的先跑”排序:四项靠一次普通抓取就能定论,三项只有你自己的服务器日志能回答,三项则是决策而不是修复。顺序本身承载着论证,因为这些项目彼此并不独立:越靠上的失败,越会让它下面的每一次测量变得无法解读。在 AI 答案已经引用过的 URL 里,有 27.1% 根本抓不下来,因为不可访问、已删除或不是文本;这就是引擎已经挑中的那批页面身上,第一层的失败率。8

关键要点
  • 第一层是对每个重要 URL 做一次抓取:状态码、原始响应里的正文、按搜索侧令牌逐个求解的 robots 结果,以及摘要指令。这四项没过之前,下面的一切都不可信。
  • 第二层之所以存在,是因为第一层测的是“服务器被配置成要做什么”,而日志记录的是“它实际做了什么”。机器人管理规则的效力高于 robots.txt,而且它不会通知你。
  • 第三层不是修复。闸门、用户触发型抓取器和“最后修改时间是否属实”都是政策判断,对新闻站正确的答案,对文档站就是错的。
  • 全部通过买到的是资格,不是引用。有两家厂商在文档里写明 robots.txt 的改动大约需要 24 小时才会被反映,所以请第二天再复查。
顺序

为什么这份清单的顺序就是清单本身?

一份清单只有在按依赖关系排序时才有价值,而技术类项目之间的依赖尤其重。下面十项里有四项,一次命令行抓取就能定论。三项需要一个月的服务器日志留存,以及一个会查日志的人。还有三项根本不是修复:它们是关于“你希望别人的机器能读到什么”的决策。按这个顺序跑不是为了整齐,而是因为只有这个顺序下,结果才有意义。

依赖只朝一个方向流。如果一次普通抓取返回的是一道挑战而不是页面,那么之后你看的每一份日志都会是沉默,而这份沉默的原因跟引擎对你有没有兴趣毫无关系。如果 robots.txt 禁掉了搜索侧令牌,一个月的抓取数据读起来就像冷淡,团队于是得出“AI 引擎不关心我们这个品类”的结论,而事实是站点自己让它们别来。如果正文只在水合之后才存在,那么一次引用率测量测的是 JavaScript 包,而不是文字。这三种都是长得跟真阴性一模一样的假阴性,所以清单靠上的失败是一条“停止”指令,而不是一条留着以后再说的备注。

成本指向同一个方向。第一层是一台笔记本加十分钟。第二层要占一个人一天,还需要你未必有的日志留存。第三层要开一次会。便宜的检查为贵的检查把关,因此对第一层失败的正确反应是:修掉它、等厂商系统跟上、再从头跑一遍,而不是往下硬推。每一项背后的道理都在它自己的文章里,并从该项目直接链出;这一页新增的是顺序和执行方式。

第一层

一次普通抓取,十分钟里能定下什么?

四项检查,每项一条命令,不需要工具也不需要账号。对每一个你希望被引擎引用的 URL 都跑一遍,而不是只跑首页。

01

各令牌下的状态码

用每个搜索侧 user agent 抓一次:curl -sIL -A OAI-SearchBot https://example.com/page。通过是 200,且最多一跳跳转。失败是 403、429、503、一层插页,或者一条跳转链。失败时去读付费墙与爬虫屏蔽

02

原始响应里的正文

把原始响应存成文件,在里面找一句你希望被引用的话。通过是这句话就在服务器发回的字节里。失败是它只有在页面跑进浏览器之后才出现。失败时去读AI 爬虫到底执行不执行 JavaScript

03

按令牌逐个求解 robots.txt

对 Googlebot、OAI-SearchBot3、Claude-SearchBot4、PerplexityBot5 和 Applebot6 分别求解生效结果,再用一次真实抓取逐个确认。通过是每个搜索侧令牌都被放行;失败通常是一条被继承下来的通配符全站禁止。失败时去读哪些爬虫令牌真正重要

04

已收录且可带摘要展示

Google 明示的要求是页面“必须已被收录,并且有资格带摘要出现在 Google 搜索里”。1 通过是一个自指的 canonical,且 head 和响应头里都没有 noindex、nosnippet 或 max-snippet 指令。失败时去读可抓取性与收录

结果要按 URL 记录,不要按站点记录。首页几乎总能四项全过;真正承载你答案的深层页面才是第一层出问题的地方,而那些页面恰恰是引擎需要的。四项里有两项还常常一起失败,因为客户端渲染的应用往往部署在带机器人规则的边缘配置上,只修其中一个,症状原封不动。这一切为什么会给后面所有工作封顶,在可检索性作为天花板里单独论证。

第二层

哪些问题只有你自己的日志能回答?

第一层测的是服务器“本该”做什么。日志记录的是它实际做了什么,而这两者不一致的频率比谁想的都高。

05

按令牌按天统计的到访

把三十天的访问日志按 user agent 过滤,对每个搜索侧令牌分别计数。通过是每个你放行的令牌都有非零且大致平稳的计数。失败是某个 robots.txt 明明允许的令牌计数为零,说明在文件和日志之间有东西把它们丢掉了。失败时去读真实的 AI 抓取流量长什么样

06

被浪费掉的抓取

统计每个令牌的请求里返回 404 或跳转的占比。某基础设施服务商 2024 年 12 月的日志研究报告:ChatGPT 爬虫有 34.82%、Claude 有 34.16% 的抓取落在 404 上,而 Googlebot 是 8.22%。7 通过是你更接近 Googlebot 那个数字而不是它们;差距指向过期站点地图或已退役的 URL 模式。

07

无声的挑战

按令牌找出 403、429 和 503 响应,并且要读防火墙自己的事件日志,而不只是 Web 服务器的。Perplexity 的文档就告诉站点所有者:可能需要在 Web 应用防火墙里显式放行它的机器人。5 通过是被放行的令牌上没有任何挑战事件。

第 07 项是最常和纸面配置对不上的一项。robots 指令是一个请求,靠守规矩的爬虫自愿遵守;机器人管理规则则是一次强制,它在你的应用看到任何东西之前就已经触发,而且通常由另一个团队维护,不是维护 robots 文件的那个团队。两者冲突时赢的是强制,于是 robots 文件可以错上好几个月,却不产生任何会被人注意到的症状。有个团队围绕一次 robots.txt 修正做了前后对比,发现抓取量纹丝不动,最后在边缘的托管机器人规则集里找到了原因,而不是在他们刚改过的那个文件里。日志数据该怎么读,包括怎么分辨一个真爬虫和一个只是顶着它名字的东西,在读爬虫日志里讲。

第三层

剩下的哪些是决策而不是修复?

最后三项没有任何清单能提供的正确答案。它们需要一个能说清“这个站是干什么用的”的人。

08

闸门:有意的还是顺手加的

明确决定哪些内容放在登录、付费墙或同意墙后面,并把这个决定写下来。通过是这道闸有人选、有人负责。失败是一道没人选过的闸,最常见的是被标签管理器塞进来的同意弹层。这笔取舍本身在付费墙与爬虫屏蔽里论证。

09

用户触发型抓取器

ChatGPT-User、Claude-User 和 Perplexity-User 是因为有人提问才抓取的,不按抓取计划走;Perplexity 在文档里写明“既然这次抓取是用户发起的,该抓取器一般会忽略 robots.txt 规则”。5 通过是你已经决定了要怎么对待它们。把它们当爬虫看,是一个选择,不是默认。

10

一个属实的最后修改时间

把 Last-Modified 响应头和任何对外发布的修改时间,跟真正的最后一次编辑对一对。通过是它们一致。失败是构建流程把今天盖在每一个文件上,这会让“新鲜度”在你整个域名上失去意义,而不只是在某一页上。

这三项都没有脚本能算出来的通过标准,这正是它们排在最后而不是最前的原因。它们的变动频率也最低。第 08 项值得在商业模式变化时重新过一遍,第 09 项在厂商发布新文档时,第 10 项则只需要一次,等有人把构建流程修好。它们上面的一切都值得定一个周期,因为把那些项目弄坏的,是发布和基础设施变更,而没人会把这两件事标注成“会弄坏检查清单”。

范围

哪些项目被刻意排除在外?

在清单上,按顺序

  • 各搜索侧令牌下的状态码
  • 正文出现在原始响应里
  • 按令牌逐个求解的 robots.txt 结果
  • 已收录、canonical 干净、允许摘要
  • 自己日志里各令牌的到访
  • 各令牌的 404 与跳转占比
  • 被放行的令牌上没有无声的防火墙挑战
  • 闸门是有意设的且有人负责
  • 对用户触发型抓取器有明确政策
  • 属实的最后修改时间

不在清单上,以及为什么

  • llms.txt:Google 自己的指引说搜索并不使用这类文件
  • 为了赢得引用而加的 schema 标记,而不是为了富媒体结果
  • 屏蔽训练令牌,它改变的是模型学到什么,而不是答案引用什么
  • 通配符全站禁止,它会把你本想留下的搜索爬虫一起端掉
  • 任何建立在“爬虫命中量”之上、却说不出样本和分母的打法

这些排除项不是口味问题。Google 的指引写道:你“不需要为了出现在 Google 搜索(包括其生成式 AI 能力)里而创建新的机器可读文件、AI 文本文件、标记或 Markdown,因为 Google 搜索本身并不使用它们”。2 这句话是第一方的、带日期的,这一点已经胜过它排除掉的那些打法所能拿出的任何东西。结构化数据依然值得为富媒体结果而上,那里的证据老而可靠;没有任何证据支撑的,是被硬挂在它身上的“能拿引用”这个说法。而且一份把所有听起来合理的项目都收进去的清单,会毁掉自己的用途。十项会被真的跑完。二十五项只会被扫一眼,而真正要紧的那四项,恰好在被扫过去的那一段里。

节奏

这份清单该多久跑一次?

只要有发布动到了路由、渲染、响应头或边缘配置,就把第一层重跑一遍;对多数团队来说这意味着每周,而不是每季度。第二层每月重跑,因为它的信号是趋势,一天的日志只是噪声。第三层按它自己的节奏走:跟着业务变,而不是跟着代码变。

复查之前先等一天。OpenAI 的文档写着,站点更新 robots.txt 后“可能需要约 24 小时我们的系统才会调整”3;Perplexity 写的是改动“最多可能需要 24 小时”才被反映。5 修完一小时就复测、然后读到旧行为,是一个团队说服自己放弃一次正确改动的最常见方式。

把结果存在能留住的地方,一次运行、一个 URL 一行,带上日期。第二次运行的价值在于它与第一次的差异,而一份只活在终端历史里的清单产生不了任何差异。除了通过与失败之外,还有两列值得一直带着:哪一项失败了,以及两次运行之间发布了什么。这个配对是这套动作唯一能产出的因果证据。它是弱证据,但它是你真的收得到的那一种。

这份清单的诚实边界

一份十项的清单会暗示这十项已经穷尽,并且“全过”本身就是一个结果。两者都不成立。这份清单穷尽的只是那些从站外和你自己日志里就能便宜地检出的失败;一个页面完全可以十项全过,却与引擎实际发出的任何一条查询都不匹配,而那是这一页看不见的覆盖面问题。通过确立的是资格,不是引用,而这两者之间隔着引擎之后做出的每一次排序、选择与合成决策。2026 年那篇批判性综述把“引用分数能预测点击、转化或收入”这一说法评为“非常低”置信度。9 请把一份跑完的清单读作“障碍已清除”,永远不要读作结果。第一层背后的证据是第一方厂商文档,很扎实;而把其中任何一项连到钱上的证据,目前并不存在。

产品在哪里派得上用场,在哪里派不上

上面每一项都是免费的。第一层要的是 curl 和十分钟,第二层要的是你本来就有的日志权限,第三层要的是一个没有软件能替你做的决定。Bavior 一样都不做:它不爬你的站,不读你的 robots.txt,也没法把一个被屏蔽的页面变得可抓取。Bavior 覆盖的是这份清单之后的那一段:按计划把一组固定的 prompt 打到多个引擎上,记录每条答案引用了哪些来源,从而让你知道第一层的修复有没有改变“谁被引用”。请先跑清单,因为去测量一个抓不到的页面,等于什么都没测。一条答案里你现实中能占到多少,在答案里有多少属于你里展开。

出处,全部核查于 2026 年 8 月 30 日
  1. Google Search Central,《AI features and your website》,最后更新于 2025 年 12 月 10 日(已收录且可带摘要展示的准入要求;第一方):developers.google.com/search/docs/appearance/ai-features
  2. Google Search Central,《Google’s Guide to Optimizing for Generative AI Features on Google Search》,最后更新于 2026 年 7 月 10 日(不需要新增 AI 文本文件;第一方):developers.google.com/search/docs/fundamentals/ai-optimization-guide
  3. OpenAI 爬虫与机器人文档(OAI-SearchBot、GPTBot、ChatGPT-User;robots.txt 改动约需 24 小时被反映;第一方):developers.openai.com/api/docs/bots
  4. Anthropic,《Does Anthropic crawl data from the web?》(ClaudeBot、Claude-SearchBot;第一方):support.claude.com/en/articles/8896518
  5. Perplexity 机器人文档(PerplexityBot、Perplexity-User;用户触发型抓取;防火墙放行;第一方):docs.perplexity.ai/guides/bots
  6. Apple,《About Applebot》(Applebot、Applebot-Extended;第一方):support.apple.com/en-us/119829
  7. Zecchini、Moore、Ubl、Siddle,《The rise of the AI crawler》,Vercel,2024 年 12 月 17 日;各爬虫的 404 与跳转占比(基础设施第一方日志数据):vercel.com/blog/the-rise-of-the-ai-crawler
  8. Allaham 与 Diakopoulos,2026;被引用的 URL 有 27.1% 抓不下来,因为不可访问、已删除或不是文本(预印本,经第 9 条综述转述)
  9. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023 to 2026)》,arXiv:2607.14035;表 5 把“引用分数能预测点击或收入”评为“非常低”置信度:arxiv.org/abs/2607.14035
常见问题

你想知道的,都在这里。

这份清单上最常见的失败是哪一项?

第 03 项,具体说是 robots.txt 里那条比团队里任何人都资历更老的通配符全站禁止。它会一次性把所有搜索侧爬虫挡掉,它在日志里留下的痕迹跟“引擎真的对你没兴趣”一模一样,而且只要你是从上往下读文件、而不是逐个令牌去求解,它就一直看不见。在花一整天钻日志之前,先查这一项。

如果第一层全过了,日志那部分能跳过吗?

不能,因为第一层测的是意图,日志测的是执行。边缘上的机器人管理规则会在你的应用和 robots.txt 被问到之前就把请求挡掉,而这条规则通常由另一个团队维护。Perplexity 自己的文档就提醒站点所有者:如果用了 Web 应用防火墙,可能需要显式把它的机器人加进白名单。这些第一层一个都看不见。

修好之后,多久才该看到变化?

行为上要超过一天,结果上要更久。OpenAI 的文档写着 robots.txt 的改动大约需要 24 小时才会被系统反映,Perplexity 写的是最多 24 小时;所以当天下午的复测读到的还是旧状态,看起来就像没修好。接下来动的是抓取量,尺度是几周。至于引用会不会跟着来,那是另一个问题,这份清单并不回答它。

十项全过,是不是就意味着会被引用?

不是。这份清单确立的是“资格”,也就是你有没有可能成为候选,仅此而已。选择、排序和合成都发生在它之后,而一个页面完全可能十项全过,却与引擎实际发出的任何一条查询都不匹配。请把“全过”读成“障碍已清除”,然后回去做覆盖面和内容的活。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

资格只是地板,不是终点。
通过之后,去看看究竟谁被引用了。

免费试用