这取决于你造的是哪一种,而相当多的出版商造的正是那种根本拦不住机器的。客户端遮罩式付费墙会把整篇文章发给浏览器,再用一层订阅提示把它盖住。Tow 中心点名 MIT Technology Review、National Geographic 和 Philadelphia Inquirer 用的是这种做法,并观察到“虽然这些内容对人不可见,但像 Atlas 和 Comet 这样的 AI 智能体仍然能读到它”。而服务端付费墙,它归到了 Wall Street Journal 和 Bloomberg 名下,在凭据通过验证之前不会发送任何正文。2
2025 年 10 月的那次演示,是两个方向的失败正面相遇时最干净的一份公开案例。当被要求给出 MIT Technology Review 一篇九千词订阅专享文章的全文时,两款智能体浏览器把它交了出来;而同样两家公司标准对话界面上的同一条指令被拒绝了,因为该刊已经屏蔽了这两家公司的爬虫。屏蔽对爬虫有效,对浏览器则毫不相干;而一旦一位已订阅的读者把自己的智能体指向那个页面,服务端付费墙同样救不了它。
关于“收录”的那一半问题,有一个不需要欺骗任何人的成文答案。Google 关于订阅与付费墙内容的结构化数据指引之所以存在,用它自己的话说,是因为这些标记“帮助 Google 把付费墙内容与伪装(cloaking)这种违反垃圾内容政策的做法区分开”,而它开篇就先把自己的适用范围收窄:“本指南只适用于你希望被抓取和收录的内容。”9 用 isAccessibleForFree 和 hasPart 标出被门禁的那部分,就是页面在你继续收费的同时保住资格的方式。而在没有这些标记的情况下,把你对读者藏起来的正文喂给爬虫,正是这条政策所称的伪装,本课程不会把这种手法交到你手上。