首页/学习 GEO/爬虫令牌
技术 GEO · 做决定

哪些爬虫令牌要紧,而哪一个是不该屏蔽的那个?

每个令牌都是一条独立的规则,各有各的代价;两种错误的方向恰好相反:屏蔽错的那个会让你离开答案,屏蔽你本想屏蔽的那个则什么看得见的变化都没有。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

决定引擎能不能引用你的,是它的搜索侧爬虫,一共五个:OAI-SearchBot、Claude-SearchBot、PerplexityBot、Applebot 和 Googlebot。每个训练侧令牌都是另一条规则、另一种后果,所以禁止 GPTBot、ClaudeBot 或 Applebot-Extended,不会从任何“带搜索的回答”里拿走任何东西。光是 Google,就在两个页面上记录了十一个常规爬虫令牌和九个用户触发抓取器,并指出其中只有一个是搜索里 AI 功能的控制项:写给 Googlebot 的指令。567

关键要点
  • 除非你有具体理由,否则放行那五个搜索侧令牌;文件里其余每一行都当作一个独立的、有独立价码的决定。
  • 有一个训练令牌不再是零代价:Google-Extended 现在同时管训练和“接地”,所以禁止它会把你从 Gemini Apps 里移除,而 AI Overviews 和 AI Mode 不受影响。
  • 代价高昂的屏蔽几乎从来不是选出来的:一条通配符禁止、一条 Apple 文档写明 Applebot 也会遵守的 Googlebot 规则,以及一条压根不读 robots.txt 的防火墙规则。
  • 四家的用户触发抓取器里有三家按设计就忽略 robots.txt。Anthropic 的 Claude-User 是你真能关掉的那一个,而关掉它的代价是失去“有人正在问”的那一刻的取用。
那个例外

屏蔽每个令牌,实际要付什么代价?

Google-Extended 是值得读两遍的那一行。Google 的文档把它描述为一个令牌,用来管理抓取内容是否“可被用于训练未来几代 Gemini 模型”、以及是否可用于“接地(在提问当下把 Google 搜索索引中的内容提供给模型,以提升事实性与相关性),涵盖 Gemini Apps 与 Vertex AI 上的 Grounding with Google Search”的令牌;而同一条目又写明,Google-Extended“不影响站点在 Google 搜索中的收录,也不被用作 Google 搜索的排序信号”。5 这两半同时成立,合起来划出一条大多数文章漏掉的线:禁止 Google-Extended,是一个“退出 Gemini 助手”的决定,不是一个关于 AI Overviews 的决定。

AI Overviews 和 AI Mode 在这条线的另一侧,因为它们就是搜索。Google 直接点名了控制项:“AI 已内建于搜索,并且是搜索运作方式中不可分割的一部分,这也是为什么写给 Googlebot 的 robots.txt 指令,就是站点所有者用来管理其站点如何为搜索被抓取的控制项”;而要控制页面能被展示多少,用的是 nosnippetdata-nosnippetmax-snippetnoindex7 紧接着的下一句,Google 才把 Google-Extended 给出来,用于“限制 Google 其他一些系统里的 AI 训练与接地”。

其余各行同样值得逐字读。OpenAI 的措辞比常见的转述要窄:一个对 OAI-SearchBot 选择退出的站点“不会出现在 ChatGPT 的搜索回答里,但仍可能作为导航链接出现”。1 Apple 的 Applebot-Extended 根本不是爬虫,因为文档写明它“不抓取网页”,只用来“决定如何使用 Applebot 这个 user agent 抓到的数据”。4

误伤

哪个是不该屏蔽的那个,它又是怎么被误屏蔽的?

大多数情况可归为三种形态,没有一种是“有人决定要屏蔽 AI 爬虫”。

第一种形态是通配符。一个带宽泛 DisallowUser-agent: * 组,会把所有搜索侧令牌一次性移除,而它几乎总是继承来的,不是有意选的。有个团队在周五把预发布的 robots.txt 推上生产,丢掉了全站所有搜索侧抓取,两周后才从访问日志里发现,因为一个从未被抓取的页面不会产生任何“缺失的展现”,分析后台里什么也不动。

第二种形态是文档里写明的继承。Apple 的文档写道:“如果 robots 指令没有提到 Applebot 但提到了 Googlebot,Apple 的机器人会遵循 Googlebot 的指令。”4 于是,你多年前为了把 Googlebot 挡在筛选页目录外而写下的规则,同时也是一条 Applebot 规则,悄无声息地生效;而 Applebot 正是 Spotlight、Siri 和 Safari 背后的令牌。同一页还记录了 Applebot 不遵循 crawl-delay,所以用那种方式表达的限速同样毫无作用。

第三种形态压根不在 robots.txt 里。一个 Web 应用防火墙、一个机器人管理产品,或者一条过狠的限流,会在任何指令被读取之前就先作答,而一个 403 不是爬虫可以拒绝的请求。Perplexity 自己的文档里就带着一步步的 Cloudflare 和 AWS 防火墙配置说明,用来放行它的机器人,3 这挺能说明真正起约束作用的那一层,有多常压在文件之上而不在文件之内。作用域是安静的第四种:robots.txt 按主机生效,所以在营销站上设的规则,对文档子域什么也没说;Anthropic 把这一点讲得很明白,要求发布者在“每一个你希望退出的子域”上都重复一遍这项改动。2

不具约束力

用户触发抓取器到底守不守 robots.txt?

基本上不守,而且每家厂商都用自己的话说了。OpenAI 写明 ChatGPT-User 会在有人提问时访问页面,“因为这些动作由用户发起,robots.txt 规则可能不适用”,并且 ChatGPT-User“不用于判定内容是否可以出现在搜索里”。1 Perplexity 对 Perplexity-User 的写法一样:“由于是用户请求的抓取,这个抓取器通常忽略 robots.txt 规则。”3 Google 则把这条规则套在整个类别上,写道“因为该抓取是用户请求的,这些抓取器通常忽略 robots.txt 规则”;而这个类别现在包含 Google-Agent,其描述是“由托管在 Google 基础设施上的智能体使用,按用户请求浏览网页并执行动作”。6

Anthropic 是例外,而且是有用的那种例外。Claude-User 与 ClaudeBot、Claude-SearchBot 并列在同一张表里,是一个发布者可以设置访问权限的机器人;文档写明,禁用它会“阻止我们的系统在用户查询时取用你的内容,这可能降低你站点在用户主导的网页搜索中的可见度”。2

决定是从这种不对称里推出来的,不是从任何偏好里推出来的。对其中三家来说没什么可决定的。对第四家,答案几乎总是保持放行,因为一次用户触发的抓取,意味着此刻正有一个人在打听你,这是这个界面能产生的、最接近意图的东西。如果某个页面确实不能被读到,robots.txt 从来就不是那个机制;身份验证才是。

操作流程

怎样用一个下午,逐个令牌把决定做完?

01

去取那个文件,而不是读仓库

为你拥有的每一台主机,从公网请求一次 robots.txt。一条 CDN 规则、一次跳转或一次过期的部署,都会让实际提供的文件与仓库里的那份不一致,而这比预期的更常发生。

02

逐个令牌按名字判断

分组与优先级让 robots.txt 很难靠肉眼判断。请一个一个令牌地过,而不是扫一眼去找你记得自己写过的那几条规则。

03

检查文件之上的那一层

防火墙规则、机器人管理、限流和地区封锁,都会在任何指令被读取之前先作答。一个收到 403 的爬虫,永远走不到你那条 Allow。

04

按主机重复,而不是按站点

robots.txt 的作用域是单台主机。Anthropic 要求发布者在每一个想要覆盖的子域上重复这项改动,而这在“放行”方向上同样适用。2

05

先等一天再下判断

OpenAI 表示 robots.txt 更新大约需要 24 小时才会传到它的系统;Perplexity 也写明最多 24 小时。13

06

回到自己的日志里确认

决定是在一个文本文件里做出的;而它确实生效的证据,是访问日志里一次成功的搜索侧抓取,那是另一件事,有另一套坑。

默认姿态一句话就够:除非你有具体理由,否则放行全部五个搜索侧令牌;把每个训练侧令牌当成一个没有搜索代价的商业决定,Google-Extended 除外。这里没有一步会自我纠正,因为屏蔽从不会以“某个看板上掉了一截”的形式浮现出来。文件一旦对了,问题就从“你决定了什么”转向“实际到达了什么”,那是日志问题而不是 robots.txt 问题;读爬虫日志那一篇讲的是该把哪些令牌分开数、该预期怎样的错误率与量级,以及怎么确认爬虫真是它自称的那个。

衰减

任何令牌清单为什么都会过期,该怎么办?

因为这些清单今年就动过,而且动在决定上。OpenAI 现在记录了第四个令牌 OAI-AdsBot,它“只访问被提交为广告的页面”,且它收集的数据“不用于训练生成式 AI 基础模型”。1 Google 把爬虫文档整个搬出了 Search Central:/search/docs/crawling-indexing/ 下的旧路径现在会跳转到一个独立的 crawling 版块,于 2026 年 8 月 30 日核对。56 而 Google-NotebookLM 在抓取器页面上只作为“支持至 2026 年 8 月的旧 agent”出现,由 Google-GeminiNotebook 取代,也就是说这扇窗本月就关上。6

Google 的抓取器页面提到了一项以 agent.bot.goog 为身份的 Web Bot Auth 协议实验,6 那会把爬虫的身份从请求头里一个自报的字符串,挪到某种带签名的东西上。一旦那成了常态,文本文件里的一个名字就不再是做决定的单位,按 user agent 放行也就不再是那个机制。

Google 的两个页面还都写着清单“并不详尽”,另有第三个页面覆盖特殊情况的爬虫,所以请把上面那些令牌当作下限而不是普查。接下来的事并不好看:在日历里放一个周期性提醒,重读那五份厂商文档,再和你文件里假定的东西做个 diff。一份只写过一次的 robots.txt,会持续替你做决定,而做决定的依据是一个没人在看的文件,它造成的失败也是无声的。

这篇文章的诚实边界

本页每一条主张都是厂商的自我描述:这是强证据,但依然不是测量。文档说的是一个令牌“是干什么用的”,不是它背后的爬虫“实际做了什么”;而且没有任何公开研究,把某个具体站点上的一次 robots.txt 改动,和该站点被引用率的一次可测变化连起来,所以从“放行了搜索令牌”到“被引用了”这一步,在这里是假定的,不是被证明的。这些页面老化的速度也不一样:Anthropic 那页标着 2026 年 4 月 7 日,Perplexity 那页标着 2026 年 1 月 29 日,Google 的 AI 功能页标着 2025 年 12 月 10 日、生成式 AI 指南标着 2026 年 7 月 10 日,而 OpenAI 那页干脆没有日期。另外,robots.txt 是请求而不是访问控制,所以以上没有一条描述了一个不表明身份的抓取器会做什么。

产品能做什么,不能做什么

本页的每一个决定都是免费的,一个下午就能做完:为每台主机取一次实际提供的 robots.txt,逐个令牌按名字判断,检查它之上的防火墙层,按子域重复一遍,然后等一天。没有任何工具能替你做这个判断:“你的内容该不该去训练别人的模型”是商业问题,不是技术问题。Bavior 做的是闸门之后那一层:它按计划在五个引擎上跑一组固定的提示词,并记录每个回答引用了哪些来源,这样你能看出一次令牌改动有没有改变露面的是谁。它不会去改你的 robots.txt,不会读你的服务器日志,不能解开你的防火墙正在拒绝的页面,也不能告诉你新拿到的某次引用就是你改的那个令牌换来的。免费 AI 可见度检查免费 GEO 审计无需付费方案即可使用;付费方案按月起价 $99/月,按年为 $79.17/月(截至 2026 年 8 月 30 日)。

出处,全部于 2026 年 8 月 30 日核对
  1. OpenAI,《Overview of OpenAI Crawlers》(OAI-SearchBot、OAI-AdsBot、GPTBot、ChatGPT-User;“放行其一、禁止其二”;页面无日期):developers.openai.com/api/docs/bots
  2. Anthropic,《Does Anthropic crawl data from the web, and how can site owners block the crawler?》,标注 2026 年 4 月 7 日(ClaudeBot、Claude-SearchBot、Claude-User;禁用各自的后果;逐子域):support.claude.com/en/articles/8896518
  3. Perplexity,《Perplexity Crawlers》,标注 2026 年 1 月 29 日(PerplexityBot;Perplexity-User“通常忽略 robots.txt 规则”;防火墙配置步骤):docs.perplexity.ai/docs/resources/perplexity-crawlers
  4. Apple,《About Applebot》(Applebot 与 Applebot-Extended;遵循 Googlebot 指令的回退规则;不支持 crawl-delay):support.apple.com/en-us/119829
  5. Google,《List of Google’s common crawlers》(十一个令牌;Google-Extended 关于训练、接地与“不影响搜索”的措辞):developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers
  6. Google,《List of Google user-triggered fetchers》(九个抓取器;Google-Agent;Google-NotebookLM 由 Google-GeminiNotebook 取代;Web Bot Auth 实验):developers.google.com/crawling/docs/crawlers-fetchers/google-user-triggered-fetchers
  7. Google Search Central,《AI features and your website》,更新于 2025 年 12 月 10 日(Googlebot 是搜索中 AI 功能的控制项;摘要控制项):developers.google.com/search/docs/appearance/ai-features
  8. Google Search Central,《Google’s Guide to Optimizing for Generative AI Features on Google Search》,更新于 2026 年 7 月 10 日(生成式功能“根植于我们核心的搜索排序与质量系统”):developers.google.com/search/docs/fundamentals/ai-optimization-guide
常见问题

你想知道的,都在这里。

屏蔽 Google-Extended 现在还是零代价吗?

不完全是,而且这一点变了。Google 的爬虫文档现在把 Google-Extended 描述为同时管两件事:训练未来的 Gemini 模型,以及“接地”,也就是在提问当下把 Google 搜索索引里的内容喂给模型,覆盖 Gemini Apps 和 Vertex AI。同一条目仍然写明它不影响站点在 Google 搜索里的收录,也不是搜索的排序信号。所以禁止它的代价是失去 Gemini 助手,而 AI Overviews 和 AI Mode 不受影响。

我能阻止 AI 助手在用户提问时抓取我的页面吗?

用 robots.txt 通常不行。OpenAI 写明 ChatGPT-User 的规则可能不适用,因为该动作由用户发起;Perplexity 写明 Perplexity-User 通常忽略 robots.txt;Google 对它整个用户触发抓取器类别(包括 Google-Agent)也是同样的说法。Anthropic 是例外:Claude-User 是一个你可以设置访问权限的机器人,禁用它会阻止系统在用户查询时取用你的内容。想要比这更强的效果,需要的是身份验证,而不是一条指令。

如果我只检查 robots.txt 里的一行,该检查哪一行?

通配符那一组。User-agent 星号下面一条宽泛的 Disallow 会把所有搜索侧爬虫一次性移除,而它通常是从预发布环境的文件或某个平台默认值继承来的,不是有意选的。先查它,再去查任何具名令牌,然后确认那五个搜索侧令牌在你拥有的每一台主机上都被放行,而不只是在主营销域名上。robots.txt 是按主机生效的,子域名需要自己的文件。

robots.txt 能让我的内容不出现在 AI 答案里吗?

它能挡住那些遵守规则的爬虫,而这并不是一回事。一条指令是请求而不是访问控制,用户触发型抓取器按设计基本都会忽略它,而且你文件里的任何内容都管不了别人的页面怎么写你。引擎完全可以根据一篇测评、一个论坛帖子或一份竞品对比来准确描述你的产品,而那些东西是它从别处取来的。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

一个文本文件里的一行,
决定了谁有资格引用你。

免费试用