把第三列读成那个决定,因为只有它在性质上不同。每一个搜索侧的行,描述的都是厂商愿意直说的损失;每一个训练侧的行,描述的都是厂商说并不存在的损失。“带搜索的回答”是从索引里组装出来的,而索引由搜索侧爬虫构建,所以一个不在索引里的站点,就不在答案里,无论别的令牌被放行成什么样。表里唯一的例外是 Google-Extended,而它新到大多数流传中的建议仍把它归进“屏蔽是免费的”那一类。
哪些爬虫令牌要紧,而哪一个是不该屏蔽的那个?
每个令牌都是一条独立的规则,各有各的代价;两种错误的方向恰好相反:屏蔽错的那个会让你离开答案,屏蔽你本想屏蔽的那个则什么看得见的变化都没有。
本页内容
决定引擎能不能引用你的,是它的搜索侧爬虫,一共五个:OAI-SearchBot、Claude-SearchBot、PerplexityBot、Applebot 和 Googlebot。每个训练侧令牌都是另一条规则、另一种后果,所以禁止 GPTBot、ClaudeBot 或 Applebot-Extended,不会从任何“带搜索的回答”里拿走任何东西。光是 Google,就在两个页面上记录了十一个常规爬虫令牌和九个用户触发抓取器,并指出其中只有一个是搜索里 AI 功能的控制项:写给 Googlebot 的指令。567
关键要点- 除非你有具体理由,否则放行那五个搜索侧令牌;文件里其余每一行都当作一个独立的、有独立价码的决定。
- 有一个训练令牌不再是零代价:Google-Extended 现在同时管训练和“接地”,所以禁止它会把你从 Gemini Apps 里移除,而 AI Overviews 和 AI Mode 不受影响。
- 代价高昂的屏蔽几乎从来不是选出来的:一条通配符禁止、一条 Apple 文档写明 Applebot 也会遵守的 Googlebot 规则,以及一条压根不读 robots.txt 的防火墙规则。
- 四家的用户触发抓取器里有三家按设计就忽略 robots.txt。Anthropic 的 Claude-User 是你真能关掉的那一个,而关掉它的代价是失去“有人正在问”的那一刻的取用。
到底哪个令牌决定你能不能被引用?
下表里只有一列是那个决定。其余都是你可能出于别的理由去设的规则,而它们都不改变“带搜索的回答”能不能引用你。
| 令牌 | 厂商文档说它管什么 | 禁止它要付的代价 |
|---|---|---|
| OAI-SearchBot | ChatGPT 内的搜索 | 选择退出的站点“不会出现在 ChatGPT 的搜索回答里”,但仍可能作为导航链接出现1 |
| GPTBot | 抓取内容是否用于训练基础模型 | 在搜索上毫无代价。文档就描述了放行 OAI-SearchBot 同时禁止 GPTBot 的做法1 |
| Claude-SearchBot | 为 Claude 的搜索索引你的内容 | “可能降低你站点在用户搜索结果中的可见度与准确度”2 |
| ClaudeBot | 为模型训练收集网页内容 | 在搜索上毫无代价。今后的材料会被排除在训练数据集之外2 |
| PerplexityBot | 在 Perplexity 结果中呈现并链接站点 | 从那些结果中被移除。Perplexity 文档里根本没有训练爬虫3 |
| Applebot | Spotlight、Siri 与 Safari 的搜索 | 三者一次性全丢4 |
| Applebot-Extended | Applebot 已抓取的数据可以怎么用 | 毫无代价。它“不抓取网页”,且禁止它的页面“仍可被收入搜索结果”4 |
| Googlebot | Google 搜索,以及其中的每一项 AI 功能 | 全部,包括 AI Overviews 和 AI Mode7 |
| Google-Extended | Gemini 的训练与 Gemini 的接地 | Gemini Apps 与 Vertex AI 上的接地。不影响 Google 搜索的收录或排名5 |
屏蔽每个令牌,实际要付什么代价?
Google-Extended 是值得读两遍的那一行。Google 的文档把它描述为一个令牌,用来管理抓取内容是否“可被用于训练未来几代 Gemini 模型”、以及是否可用于“接地(在提问当下把 Google 搜索索引中的内容提供给模型,以提升事实性与相关性),涵盖 Gemini Apps 与 Vertex AI 上的 Grounding with Google Search”的令牌;而同一条目又写明,Google-Extended“不影响站点在 Google 搜索中的收录,也不被用作 Google 搜索的排序信号”。5 这两半同时成立,合起来划出一条大多数文章漏掉的线:禁止 Google-Extended,是一个“退出 Gemini 助手”的决定,不是一个关于 AI Overviews 的决定。
AI Overviews 和 AI Mode 在这条线的另一侧,因为它们就是搜索。Google 直接点名了控制项:“AI 已内建于搜索,并且是搜索运作方式中不可分割的一部分,这也是为什么写给 Googlebot 的 robots.txt 指令,就是站点所有者用来管理其站点如何为搜索被抓取的控制项”;而要控制页面能被展示多少,用的是 nosnippet、data-nosnippet、max-snippet 和 noindex。7 紧接着的下一句,Google 才把 Google-Extended 给出来,用于“限制 Google 其他一些系统里的 AI 训练与接地”。
其余各行同样值得逐字读。OpenAI 的措辞比常见的转述要窄:一个对 OAI-SearchBot 选择退出的站点“不会出现在 ChatGPT 的搜索回答里,但仍可能作为导航链接出现”。1 Apple 的 Applebot-Extended 根本不是爬虫,因为文档写明它“不抓取网页”,只用来“决定如何使用 Applebot 这个 user agent 抓到的数据”。4
哪个是不该屏蔽的那个,它又是怎么被误屏蔽的?
大多数情况可归为三种形态,没有一种是“有人决定要屏蔽 AI 爬虫”。
第一种形态是通配符。一个带宽泛 Disallow 的 User-agent: * 组,会把所有搜索侧令牌一次性移除,而它几乎总是继承来的,不是有意选的。有个团队在周五把预发布的 robots.txt 推上生产,丢掉了全站所有搜索侧抓取,两周后才从访问日志里发现,因为一个从未被抓取的页面不会产生任何“缺失的展现”,分析后台里什么也不动。
第二种形态是文档里写明的继承。Apple 的文档写道:“如果 robots 指令没有提到 Applebot 但提到了 Googlebot,Apple 的机器人会遵循 Googlebot 的指令。”4 于是,你多年前为了把 Googlebot 挡在筛选页目录外而写下的规则,同时也是一条 Applebot 规则,悄无声息地生效;而 Applebot 正是 Spotlight、Siri 和 Safari 背后的令牌。同一页还记录了 Applebot 不遵循 crawl-delay,所以用那种方式表达的限速同样毫无作用。
第三种形态压根不在 robots.txt 里。一个 Web 应用防火墙、一个机器人管理产品,或者一条过狠的限流,会在任何指令被读取之前就先作答,而一个 403 不是爬虫可以拒绝的请求。Perplexity 自己的文档里就带着一步步的 Cloudflare 和 AWS 防火墙配置说明,用来放行它的机器人,3 这挺能说明真正起约束作用的那一层,有多常压在文件之上而不在文件之内。作用域是安静的第四种:robots.txt 按主机生效,所以在营销站上设的规则,对文档子域什么也没说;Anthropic 把这一点讲得很明白,要求发布者在“每一个你希望退出的子域”上都重复一遍这项改动。2
用户触发抓取器到底守不守 robots.txt?
基本上不守,而且每家厂商都用自己的话说了。OpenAI 写明 ChatGPT-User 会在有人提问时访问页面,“因为这些动作由用户发起,robots.txt 规则可能不适用”,并且 ChatGPT-User“不用于判定内容是否可以出现在搜索里”。1 Perplexity 对 Perplexity-User 的写法一样:“由于是用户请求的抓取,这个抓取器通常忽略 robots.txt 规则。”3 Google 则把这条规则套在整个类别上,写道“因为该抓取是用户请求的,这些抓取器通常忽略 robots.txt 规则”;而这个类别现在包含 Google-Agent,其描述是“由托管在 Google 基础设施上的智能体使用,按用户请求浏览网页并执行动作”。6
Anthropic 是例外,而且是有用的那种例外。Claude-User 与 ClaudeBot、Claude-SearchBot 并列在同一张表里,是一个发布者可以设置访问权限的机器人;文档写明,禁用它会“阻止我们的系统在用户查询时取用你的内容,这可能降低你站点在用户主导的网页搜索中的可见度”。2
决定是从这种不对称里推出来的,不是从任何偏好里推出来的。对其中三家来说没什么可决定的。对第四家,答案几乎总是保持放行,因为一次用户触发的抓取,意味着此刻正有一个人在打听你,这是这个界面能产生的、最接近意图的东西。如果某个页面确实不能被读到,robots.txt 从来就不是那个机制;身份验证才是。
怎样用一个下午,逐个令牌把决定做完?
去取那个文件,而不是读仓库
为你拥有的每一台主机,从公网请求一次 robots.txt。一条 CDN 规则、一次跳转或一次过期的部署,都会让实际提供的文件与仓库里的那份不一致,而这比预期的更常发生。
逐个令牌按名字判断
分组与优先级让 robots.txt 很难靠肉眼判断。请一个一个令牌地过,而不是扫一眼去找你记得自己写过的那几条规则。
检查文件之上的那一层
防火墙规则、机器人管理、限流和地区封锁,都会在任何指令被读取之前先作答。一个收到 403 的爬虫,永远走不到你那条 Allow。
回到自己的日志里确认
决定是在一个文本文件里做出的;而它确实生效的证据,是访问日志里一次成功的搜索侧抓取,那是另一件事,有另一套坑。
默认姿态一句话就够:除非你有具体理由,否则放行全部五个搜索侧令牌;把每个训练侧令牌当成一个没有搜索代价的商业决定,Google-Extended 除外。这里没有一步会自我纠正,因为屏蔽从不会以“某个看板上掉了一截”的形式浮现出来。文件一旦对了,问题就从“你决定了什么”转向“实际到达了什么”,那是日志问题而不是 robots.txt 问题;读爬虫日志那一篇讲的是该把哪些令牌分开数、该预期怎样的错误率与量级,以及怎么确认爬虫真是它自称的那个。
任何令牌清单为什么都会过期,该怎么办?
因为这些清单今年就动过,而且动在决定上。OpenAI 现在记录了第四个令牌 OAI-AdsBot,它“只访问被提交为广告的页面”,且它收集的数据“不用于训练生成式 AI 基础模型”。1 Google 把爬虫文档整个搬出了 Search Central:/search/docs/crawling-indexing/ 下的旧路径现在会跳转到一个独立的 crawling 版块,于 2026 年 8 月 30 日核对。56 而 Google-NotebookLM 在抓取器页面上只作为“支持至 2026 年 8 月的旧 agent”出现,由 Google-GeminiNotebook 取代,也就是说这扇窗本月就关上。6
Google 的抓取器页面提到了一项以 agent.bot.goog 为身份的 Web Bot Auth 协议实验,6 那会把爬虫的身份从请求头里一个自报的字符串,挪到某种带签名的东西上。一旦那成了常态,文本文件里的一个名字就不再是做决定的单位,按 user agent 放行也就不再是那个机制。
Google 的两个页面还都写着清单“并不详尽”,另有第三个页面覆盖特殊情况的爬虫,所以请把上面那些令牌当作下限而不是普查。接下来的事并不好看:在日历里放一个周期性提醒,重读那五份厂商文档,再和你文件里假定的东西做个 diff。一份只写过一次的 robots.txt,会持续替你做决定,而做决定的依据是一个没人在看的文件,它造成的失败也是无声的。
本页每一条主张都是厂商的自我描述:这是强证据,但依然不是测量。文档说的是一个令牌“是干什么用的”,不是它背后的爬虫“实际做了什么”;而且没有任何公开研究,把某个具体站点上的一次 robots.txt 改动,和该站点被引用率的一次可测变化连起来,所以从“放行了搜索令牌”到“被引用了”这一步,在这里是假定的,不是被证明的。这些页面老化的速度也不一样:Anthropic 那页标着 2026 年 4 月 7 日,Perplexity 那页标着 2026 年 1 月 29 日,Google 的 AI 功能页标着 2025 年 12 月 10 日、生成式 AI 指南标着 2026 年 7 月 10 日,而 OpenAI 那页干脆没有日期。另外,robots.txt 是请求而不是访问控制,所以以上没有一条描述了一个不表明身份的抓取器会做什么。
本页的每一个决定都是免费的,一个下午就能做完:为每台主机取一次实际提供的 robots.txt,逐个令牌按名字判断,检查它之上的防火墙层,按子域重复一遍,然后等一天。没有任何工具能替你做这个判断:“你的内容该不该去训练别人的模型”是商业问题,不是技术问题。Bavior 做的是闸门之后那一层:它按计划在五个引擎上跑一组固定的提示词,并记录每个回答引用了哪些来源,这样你能看出一次令牌改动有没有改变露面的是谁。它不会去改你的 robots.txt,不会读你的服务器日志,不能解开你的防火墙正在拒绝的页面,也不能告诉你新拿到的某次引用就是你改的那个令牌换来的。免费 AI 可见度检查和免费 GEO 审计无需付费方案即可使用;付费方案按月起价 $99/月,按年为 $79.17/月(截至 2026 年 8 月 30 日)。
- OpenAI,《Overview of OpenAI Crawlers》(OAI-SearchBot、OAI-AdsBot、GPTBot、ChatGPT-User;“放行其一、禁止其二”;页面无日期):developers.openai.com/api/docs/bots
- Anthropic,《Does Anthropic crawl data from the web, and how can site owners block the crawler?》,标注 2026 年 4 月 7 日(ClaudeBot、Claude-SearchBot、Claude-User;禁用各自的后果;逐子域):support.claude.com/en/articles/8896518
- Perplexity,《Perplexity Crawlers》,标注 2026 年 1 月 29 日(PerplexityBot;Perplexity-User“通常忽略 robots.txt 规则”;防火墙配置步骤):docs.perplexity.ai/docs/resources/perplexity-crawlers
- Apple,《About Applebot》(Applebot 与 Applebot-Extended;遵循 Googlebot 指令的回退规则;不支持 crawl-delay):support.apple.com/en-us/119829
- Google,《List of Google’s common crawlers》(十一个令牌;Google-Extended 关于训练、接地与“不影响搜索”的措辞):developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers
- Google,《List of Google user-triggered fetchers》(九个抓取器;Google-Agent;Google-NotebookLM 由 Google-GeminiNotebook 取代;Web Bot Auth 实验):developers.google.com/crawling/docs/crawlers-fetchers/google-user-triggered-fetchers
- Google Search Central,《AI features and your website》,更新于 2025 年 12 月 10 日(Googlebot 是搜索中 AI 功能的控制项;摘要控制项):developers.google.com/search/docs/appearance/ai-features
- Google Search Central,《Google’s Guide to Optimizing for Generative AI Features on Google Search》,更新于 2026 年 7 月 10 日(生成式功能“根植于我们核心的搜索排序与质量系统”):developers.google.com/search/docs/fundamentals/ai-optimization-guide
你想知道的,都在这里。
屏蔽 Google-Extended 现在还是零代价吗?
不完全是,而且这一点变了。Google 的爬虫文档现在把 Google-Extended 描述为同时管两件事:训练未来的 Gemini 模型,以及“接地”,也就是在提问当下把 Google 搜索索引里的内容喂给模型,覆盖 Gemini Apps 和 Vertex AI。同一条目仍然写明它不影响站点在 Google 搜索里的收录,也不是搜索的排序信号。所以禁止它的代价是失去 Gemini 助手,而 AI Overviews 和 AI Mode 不受影响。
我能阻止 AI 助手在用户提问时抓取我的页面吗?
用 robots.txt 通常不行。OpenAI 写明 ChatGPT-User 的规则可能不适用,因为该动作由用户发起;Perplexity 写明 Perplexity-User 通常忽略 robots.txt;Google 对它整个用户触发抓取器类别(包括 Google-Agent)也是同样的说法。Anthropic 是例外:Claude-User 是一个你可以设置访问权限的机器人,禁用它会阻止系统在用户查询时取用你的内容。想要比这更强的效果,需要的是身份验证,而不是一条指令。
如果我只检查 robots.txt 里的一行,该检查哪一行?
通配符那一组。User-agent 星号下面一条宽泛的 Disallow 会把所有搜索侧爬虫一次性移除,而它通常是从预发布环境的文件或某个平台默认值继承来的,不是有意选的。先查它,再去查任何具名令牌,然后确认那五个搜索侧令牌在你拥有的每一台主机上都被放行,而不只是在主营销域名上。robots.txt 是按主机生效的,子域名需要自己的文件。
robots.txt 能让我的内容不出现在 AI 答案里吗?
它能挡住那些遵守规则的爬虫,而这并不是一回事。一条指令是请求而不是访问控制,用户触发型抓取器按设计基本都会忽略它,而且你文件里的任何内容都管不了别人的页面怎么写你。引擎完全可以根据一篇测评、一个论坛帖子或一份竞品对比来准确描述你的产品,而那些东西是它从别处取来的。
负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。
发现数字有误?告诉我们,我们会重新核查:support@bavior.com