首页/学习 GEO/付费墙与屏蔽
技术 GEO · 访问控制

付费墙和爬虫屏蔽能把你挡在 AI 答案之外吗?

凭直觉给出的答案在两个方向上都是错的。屏蔽爬虫并不能可靠地把你挡在答案之外,而完全敞开也不能可靠地把你送进答案里。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

robots.txt 里的一条禁止是一个请求:有文档的爬虫会遵守它,而由用户触发的抓取常常不会。所以它管的是“谁获准抓取你”,而不是“你能不能被写进答案”。这就让访问控制成了一个关于“你在拿什么换什么”的生意决定,而不是一个能在任一方向保证结果的开关。在 Tow 中心那项覆盖八个生成式搜索工具、一千六百条查询的测试里,某个付费版助手把它本不该拿到的九十段摘录中的近三分之一正确识别了出来。1

关键要点
  • 两家厂商在文档里写明,其“用户触发型”抓取器可能忽略 robots.txt;第三家写明自己所有机器人都遵守。同一条指令因此有三种含义。
  • 屏蔽不能阻止你被转述。转载副本、第三方报道,以及由人驾驶的普通 Chrome 会话,都会绕开它。
  • 屏蔽也不是毫无作用。厂商文档写明退出会把你从它们的搜索回答里移除,而一次成功的屏蔽被观察到让答案变得含糊,而不是让答案消失。
  • 有些屏蔽和你本想留下的东西绑在一起:一个搜索索引、你自己的摘要,或者厂商读取你那份意愿文件的能力。
  • 关于一次屏蔽在引用上到底损失多少,至今没有一份符合本课程出处标准的测量,所以这笔交易的量级是真的未知。
定义

robots.txt 里的禁止到底做了什么?

它请求某个抓取器不要请求某个路径。这是一份公开的请求,有文档、守规矩的爬虫会遵守它,而它从来都不是访问控制:文件是公开的,它把你在意的路径一一点名,而执行这件事的每一个环节都在对方那一侧。那家提供了部署最广的托管版 robots.txt 的基础设施服务商,对自己更新的信号方案就是这么说的:内容信号“表达的是偏好;它们不是针对抓取的技术性反制手段。有些公司可能干脆忽略它们。”4

决定多数结果的那道分界,不是训练与搜索之分,那部分由检索阶段覆盖。真正的分界是“按计划的爬取”与“因为有人提了要求才发生的抓取”,而在后一条边界上,各家厂商在自己的文档里互相矛盾。下表中的每一处引文,都在 2026 年 8 月 30 日对照厂商线上页面核对过。

由人触发的抓取令牌厂商文档里关于 robots.txt 的表述
OpenAIChatGPT-User“因为这些动作由用户发起,robots.txt 规则可能不适用”5
PerplexityPerplexity-User“由于是用户请求的抓取,该抓取器通常忽略 robots.txt 规则”7
AnthropicClaude-User其机器人“通过遵守 robots.txt 中的行业标准指令来尊重‘请勿抓取’信号”6
Google没有单独令牌针对 Googlebot 的指令就是搜索(含 AI 功能)的既定控制手段8
智能体浏览器没有它不是爬虫:其智能体“与一个用标准 Chrome 浏览器的人无法区分”2

最后一行请读两遍,因为它打破的正是多数人脑子里那套模型。智能体浏览器不是一个带着礼貌 user-agent 的爬虫。它是一个由人在驾驶的浏览器,没有任何指令是针对它的,而屏蔽它的流量特征就等于屏蔽 Chrome。

证据

被屏蔽的出版商为什么照样被引用?

因为那条答案并不需要你的页面。2025 年 3 月,哥伦比亚大学 Tow 数字新闻中心跑了一千六百条查询,覆盖八个生成式搜索工具,做法是贴入一段摘录,请每个工具说出对应文章的标题、出版方、日期和 URL。在“平台从有意屏蔽了它们爬虫的出版商那里取到了信息”这个小标题下,某个助手的免费版把来自 National Geographic 付费文章的十段摘录全部正确识别,而这家出版商既禁止了它的爬虫,也与该公司没有任何关系。1

有三条路径会绕开屏蔽,其中只有第三条存在争议。第一条是转载:USA Today 屏蔽了某个助手的爬虫,而该助手引用了 Yahoo News 转载的同一篇文章。第二条是第三方报道,也就是某个智能体在不愿直接触碰某家出版商时的退路,它给出了“一份拼合式摘要,取材自关于该文章的推文、各种转载版本、其他媒体中的引述,以及网络上的相关报道”。2 第三条是不遵守。2025 年 8 月 4 日,Cloudflare 发布了一份调查,称它注册了全新的、从未被收录的域名,其 robots.txt 禁止一切抓取,而某个助手仍然返回了关于这些域名的详细内容,流量来自一个通用 Chrome user-agent、地址在该厂商公布范围之外,并称它已把该厂商从可信机器人名单中除名;该厂商次日否认了隐蔽抓取,这场分歧至今没有在公开场合得到解决。3

Tow 中心对整幅图景的概括是最值得记住的一句:“想要在搜索结果里获得可见度的出版商没有得到它,而希望退出的那些,其内容仍然违背其意愿地留在结果中。”1 一份文件对这两种失败都控制不干净。

付费墙

付费墙是把你挡在外面,还是把你送进去?

这取决于你造的是哪一种,而相当多的出版商造的正是那种根本拦不住机器的。客户端遮罩式付费墙会把整篇文章发给浏览器,再用一层订阅提示把它盖住。Tow 中心点名 MIT Technology Review、National Geographic 和 Philadelphia Inquirer 用的是这种做法,并观察到“虽然这些内容对人不可见,但像 Atlas 和 Comet 这样的 AI 智能体仍然能读到它”。而服务端付费墙,它归到了 Wall Street Journal 和 Bloomberg 名下,在凭据通过验证之前不会发送任何正文。2

2025 年 10 月的那次演示,是两个方向的失败正面相遇时最干净的一份公开案例。当被要求给出 MIT Technology Review 一篇九千词订阅专享文章的全文时,两款智能体浏览器把它交了出来;而同样两家公司标准对话界面上的同一条指令被拒绝了,因为该刊已经屏蔽了这两家公司的爬虫。屏蔽对爬虫有效,对浏览器则毫不相干;而一旦一位已订阅的读者把自己的智能体指向那个页面,服务端付费墙同样救不了它。

关于“收录”的那一半问题,有一个不需要欺骗任何人的成文答案。Google 关于订阅与付费墙内容的结构化数据指引之所以存在,用它自己的话说,是因为这些标记“帮助 Google 把付费墙内容与伪装(cloaking)这种违反垃圾内容政策的做法区分开”,而它开篇就先把自己的适用范围收窄:“本指南只适用于你希望被抓取和收录的内容。”9 用 isAccessibleForFree 和 hasPart 标出被门禁的那部分,就是页面在你继续收费的同时保住资格的方式。而在没有这些标记的情况下,把你对读者藏起来的正文喂给爬虫,正是这条政策所称的伪装,本课程不会把这种手法交到你手上。

这笔交易

一次屏蔽到底买到了什么?

买到了一些真实的东西,也少于这场争论两边各自的说法。在遵守规则的那条路径上,屏蔽确实做到了它承诺的事。OpenAI 的文档写道:“已退出 OAI-SearchBot 的站点不会出现在 ChatGPT 的搜索回答中,但仍可能作为导航链接出现。”5 Anthropic 的文档写道,停用 Claude-SearchBot“会阻止我们的系统为搜索优化而索引你的内容,这可能降低你的站点在用户搜索结果中的可见度与准确度”。6 第二句请仔细读:厂商是在说,你一走,它关于你的准确度可能会下降。

在不遵守规则的那条路径上,关于“一次奏效的屏蔽改变了什么”,公开的观察只有一份。Cloudflare 报告称,当那个隐蔽抓取器被成功屏蔽后,该助手转而依赖其他数据来源(包括其他网站)来生成答案,而“这些答案更不具体,缺少来自原始内容的细节”。3 这就是这笔交易诚实的形状:屏蔽往往降低别人谈论你的质量,而不是让别人不再谈论你。

反过来,用准入去换一纸合同,同样买不到准确。Tow 中心把“与新闻机构签订内容授权协议,并不能保证聊天机器人回答中的引用是准确的”列为其五项发现之一,而它给出的实例很不留情:San Francisco Chronicle 既放行 OpenAI 的搜索爬虫,也处在 Hearst 与该公司的合作关系之内,而那个助手在十段受测摘录中只正确识别了一段。1 准入是准确署名的前提,不是它的成因。

副作用

哪些屏蔽的代价超出了你的本意?

有三种绑定会把一个狭窄的意图变成一次宽泛的损失。在 Google 这边不存在“只针对 AI”的指令:“AI 已经内建于搜索,并且是搜索运作方式中不可分割的一部分,正因如此,针对 Googlebot 的 robots.txt 指令,才是站点所有者管理其站点如何被搜索抓取的控制手段。”它点名的那些更细的控制,nosnippet、data-nosnippet、max-snippet 和 noindex,同样会砍掉你的普通结果;而 Google-Extended 管的是 Google 其他系统里的训练与语料接入,不是搜索。8 在 Tow 中心样本里那些公开了爬虫的工具中,有一个没有被二十家出版商中的任何一家屏蔽,研究者把这归因于它与一个通用搜索引擎共用爬虫,因此屏蔽它就意味着退出那个引擎的索引。1

第三种绑定会把你想要的效果反过来。Anthropic 的文档写道:“像屏蔽 Anthropic 机器人所使用的 IP 地址这类替代做法,可能无法正确生效,也无法持久保证退出,因为这么做会妨碍我们读取你的 robots.txt 文件。”6 一条冲着爬虫去的防火墙规则,可能让你既被抓取又不被听见,因为承载你意愿的那份文件,正是这条规则挡住对方去读的东西。

时间差会悄悄毁掉多数“前后对比”的读数。OpenAI 表示,“从站点更新 robots.txt 起,我们的系统大约需要 24 小时来调整”;Perplexity 说变更最多可能需要 24 小时才反映出来;Google 说预览控制“可能需要几天到几个月不等,取决于我们的系统判断某个页面需要多久刷新一次”。578 屏蔽不是一个开关,解除屏蔽也不是。

决策

你该怎么决定,又该把什么写下来?

在动那份文件之前,先把你要买的结果说清楚。团队通常心里想的四种结果中,两种可以拿到,一种只能拿到一半,还有一种根本不在这个机制的菜单上。

更低的抓取负载可以拿到,而且能在你自己的日志里量出来。一个谈判筹码可以拿到,而且这是商业判断而非技术判断。更少的无署名转述只能拿到一半,因为上面的证据说的是转述会退化,不是会停止。至于“控制别人的答案怎么说你”,它不在菜单上,而上文全部内容就是原因。如果一个页面真的不能被读到,请给它身份验证,而不是一条指令。

如果你想要比“允许还是禁止”更细的东西,现在已经有了一套词汇:内容信号政策(Content Signals Policy)在 robots.txt 中加入 search、ai-input 和 ai-train,并把 search 定义为“建立搜索索引并提供搜索结果”,同时写明“search 不包括提供 AI 生成的搜索摘要”。4 按其作者自己的说法,它表达的是偏好,并不强制执行。然后把四件事写下来:你选的那个结果、你动过的每一个令牌、变更日期,以及每家厂商文档里写的生效延迟。缺了后两项,你会把抓取延迟读成效果。

本文无法告诉你的事

关于一次屏蔽在引用上究竟损失多少,至今没有一份干净的公开测量。2026 年里出现过若干厂商分析,声称被屏蔽的出版商保住了大部分引用,它们的头条百分比互相打架,没有一份说明了配对设计,也没有一份达到本课程的出处标准,所以这里不引用它们的任何数字。真正达标的研究并不是为这个问题设计的:Tow 中心是按“对 AI 准入的立场各异”挑的那二十家出版商,随后测的是引用准确度而不是引用数量,既没有配对对照,也没有前后对比。Cloudflare 关于“被屏蔽后的答案变得更不具体”的观察,是一份安全调查里的定性记录,不是测量;而处在其核心的隐蔽抓取指控至今仍有争议、仍未解决。另有两件事同样未知:本文描述的智能体浏览器行为,能否在按周发版的产品里继续成立;以及在你屏蔽之后,各引擎会拿它此前已经吃进去的内容怎么办。请把这笔交易的方向当作证据充分,把它的量级当作尚未测量(核查于 2026 年 8 月 30 日)。

产品在哪里派得上用场,在哪里派不上

这个决定里没有一处需要软件。把你的 robots.txt 对照各家厂商文档里的令牌读一遍,是一个文本文件加二十分钟;确认你的服务器实际返回什么,是每个令牌一次抓取,而你自己的访问日志会告诉你到底是谁来过。至于你愿意拿什么去换,那是一场和管收入的人之间的对话。Bavior 不改你的 robots.txt,不管理你的付费墙,无法让一个被屏蔽的页面变得可抓取,也无法告诉你一次屏蔽让你损失了什么,因为那个反事实在任何人的数据里都不存在。工具能做的是测量那一半:Bavior 按计划把一组固定 prompt 打到五个引擎上,并记录每条答案引用了哪些来源,你正是这样才会注意到,文件改了之后,同一批 prompt 开始引用一个经销商列表而不是你;而当被引用的来源是一条活跃的讨论帖时,它会用你掌控的账号起草回复,在任何内容发出之前由你审批。免费 AI 可见性检测免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 30 日)。

出处,全部核查于 2026 年 8 月 30 日
  1. Jaźwińska 与 Chandrasekar,哥伦比亚大学 Tow 数字新闻中心,《AI Search Has a Citation Problem》,2025 年 3 月 6 日;八个工具、二十家出版商、一千六百条查询:cjr.org/tow_center
  2. Chandrasekar 与 Jaźwińska,哥伦比亚大学 Tow 数字新闻中心,《How AI Browsers Sneak Past Blockers and Paywalls》,2025 年 10 月 30 日;智能体浏览器、客户端与服务端付费墙:cjr.org/analysis
  3. Corral、Singhal、Mitchell 与 Tatoris,Cloudflare,《Perplexity is using stealth, undeclared crawlers to evade website no-crawl directives》,2025 年 8 月 4 日;该厂商 2025 年 8 月 5 日的公开否认在此不作链接:blog.cloudflare.com
  4. Allen,Cloudflare,《Giving users choice with Cloudflare’s new Content Signals Policy》,2025 年 9 月 24 日;search、ai-input 与 ai-train 三个信号:blog.cloudflare.com/content-signals-policy
  5. OpenAI,《Overview of OpenAI Crawlers》(OAI-SearchBot、GPTBot、ChatGPT-User,以及约 24 小时的调整窗口;第一方文档):developers.openai.com/api/docs/bots
  6. Anthropic,《Does Anthropic crawl data from the web, and how can site owners block the crawler?》,更新于 2026 年 4 月 7 日(ClaudeBot、Claude-User、Claude-SearchBot 与 IP 屏蔽;第一方文档):support.claude.com/en/articles/8896518
  7. Perplexity,《Perplexity Crawlers》(PerplexityBot、Perplexity-User,以及 24 小时的反映窗口;第一方文档):docs.perplexity.ai/guides/bots
  8. Google Search Central,《AI features and your website》,最后更新于 2025 年 12 月 10 日(Googlebot 控制声明、摘要控制、重新抓取延迟;第一方文档):developers.google.com/search/docs/appearance/ai-features
  9. Google Search Central,《Structured data for subscription and paywalled content (CreativeWork)》,最后更新于 2025 年 12 月 10 日(isAccessibleForFree、hasPart 与伪装的区分;第一方文档):developers.google.com/search/docs/appearance/structured-data/paywalled-content
常见问题

你想知道的,都在这里。

如果我把所有 AI 爬虫都屏蔽,会从 AI 答案里消失吗?

不会。在遵守规则的那条路径上,你确实会离开:OpenAI 的文档写明,已退出 OAI-SearchBot 的站点不会出现在 ChatGPT 的搜索回答里。留下来的是所有不需要你页面的东西,Tow 中心就实测到过:某工具被 USA Today 屏蔽后,转而引用了 Yahoo News 转载的同一篇文章。你失去的是署名出现,留下的是没有署名的转述。

付费墙能阻止 AI 系统读到我的文章吗?

只有服务端付费墙才行,而且即便如此,也拦不住一个已登录读者手里的智能体。客户端遮罩式付费墙会把正文发给浏览器再在视觉上盖住,所以 Tow 中心发现智能体浏览器能读到一篇九千词的订阅专享文章,而同样两家公司的对话界面则拒绝了同一条指令。如果一个页面真的不能被读到,它需要的是身份验证,而不是一条指令或一层遮罩。

内容授权协议能让我的品牌被准确引用吗?

目前唯一一份公开测试的答案是不能。Tow 中心把“与新闻机构签订内容授权协议,并不能保证聊天机器人回答中的引用是准确的”列为发现之一,其举出的例子是一家既放行搜索爬虫、又与该公司处在合作关系中的出版商,而它的十段摘录里只有一段被正确识别。准入让准确署名成为可能,但它并不产生准确署名。

我该在防火墙上屏蔽 AI 爬虫,而不是写进 robots.txt 吗?

动手之前先读一家厂商的文档。Anthropic 写明,屏蔽其机器人所用的 IP 地址“可能无法正确生效,也无法持久保证退出,因为这么做会妨碍我们读取你的 robots.txt 文件”。因此一条网络层规则可能让你既被抓取又不被听见:承载你意愿的那份文件,正是这条规则挡住对方去读的东西。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

屏蔽是一场交易,不是一个开关。
先弄清你拿什么换了什么。

免费试用