首页/学习 GEO/可抓取与被收录
GEO 与 SEO · 专题

为什么可抓取与被收录,决定了你能不能被引用?

因为可检索性是其余一切的天花板。Google 为其 AI 界面只写明了一条要求,而那是一条收录要求;2026 年一项审计发现,AI 答案引用的 URL 中有 27.1% 连抓都抓不下来;而且不存在任何可供提交的 AI 索引。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

可抓取与被收录决定你是否具备资格,因此它们是其下所有内容技巧的天花板。Google 的文档用一句话写明了这道门槛,“页面必须被收录,并且有资格带摘要出现在 Google 搜索中,满足搜索的技术要求”,并补充说没有额外的技术要求,也不需要添加任何特殊结构化数据。1 2026 年一项审计发现,AI 答案引用的 URL 中有 27.1% 根本没被抓下来,原因是无法访问、已被删除,或者不是文本。2

关键要点
  • Google 的门槛就是那条老门槛:被收录、有资格带摘要、技术上过关。它的文档写明不需要任何 AI 专用文件、标记或结构化数据,并且搜索会忽略 llms.txt。
  • 不存在 AI 索引,也没有提交端点。AI Overviews 与 AI Mode 跑在搜索索引上;微软的公开网站 grounding(将回答锚定到来源)只能用已被 Bing 收录的页面。
  • 屏蔽训练令牌对 AI 答案毫无影响;屏蔽搜索令牌才会把你从那个引擎里拿掉,而一条一刀切的 Disallow 会把所有引擎一次性拿掉。
  • robots.txt 只是请求,真正执行的是你的防火墙。请用各厂商公布的 IP 地址段来核验爬虫,而不是 user-agent 字符串,并把正文放进首个 HTML 响应里。
第一方文档

要出现在 Google AI Overviews 里,Google 究竟要求什么?

Google 只要求一件事,而且那是一条收录要求:“页面必须被收录,并且有资格带摘要出现在 Google 搜索中,满足搜索的技术要求。”同一组文档还写道,生成式功能“植根于我们核心的搜索排名与质量系统”,“出现在 AI Overviews 或 AI Mode 中没有额外要求,也不需要其他特殊优化”,以及“你不需要为出现在这些功能中而新建机器可读文件、AI 文本文件或标记。也没有需要额外添加的 schema.org 结构化数据。”1

把这段话当成边界来读,而不是鼓励。它一次性排除了整整一类付费建议:AI 专用标记、AI 专用文件、AI 专用提交。负担因此退回到“可被收录、可被抓取、有资格带摘要”这些常规工作上。同一份文档还写明 Google 搜索会忽略 llms.txt,等于用“它本想影响的那个引擎”的权威,为过去两年最流行的 AI 文件提案画上了句号。

搜索侧有两组控制项确实起作用,值得记准:nosnippet、max-snippet 与 data-nosnippet 限制 Google 可以从你的页面展示什么,noindex 则把页面整体移除。屏蔽训练爬虫不在这份清单里,理由见第四节。

并不存在的端点

有没有一个可以提交的单独 AI 索引?

不存在这样的索引,也没有任何引擎公布过对应的提交端点。每一个主流答案引擎在 grounding(将回答锚定到检索到的来源)时用的语料,要么是它自己已在运营的常规网页索引,要么是某个搜索伙伴的索引。Google 的 AI Overviews 与 AI Mode 跑在搜索索引上,Gemini 使用 Googlebot 的基础设施,而微软关于公开网站 grounding 的文档写明:需要登录才能访问、或未被 Bing 收录的 URL“不受支持”。11 OpenAI、Anthropic 和 Perplexity 各自公布了一个为搜索抓取页面的爬虫令牌,以及一个独立的训练令牌。345

由此得出的实际结论是:“进入 AI”没有一个独立的准入步骤。你的页面进入这个池子的方式和以前一样:爬虫抓到它、索引留下它、检索环节选中它。如果有人向创业者兜售“AI 收录”服务,能结束这场对话的问题只有一个:它把数据 POST 到哪个端点。这正是GEO 与 SEO这一阶段 放在所有内容技巧之下的那个前提;而真正新增的日常事务只有一件:好几个行为各异的爬虫取代了单一的主导爬虫,所以一份为 Googlebot 写的 robots.txt 已经不能描述你的全部暴露面。

失败率

可检索性到底多常失败?

频繁到值得作为第一件要查的事:2026 年一篇预印本(经那篇批判性综述转述)发现,AI 答案中已被引用过的 URL 里有 27.1% 没被抓下来,原因是不可访问、已被删除或非文本;同一项工作还把成功取回的 19,154 个页面中约 16% 标记为 AI 生成。2 分母值得点明:它测的是“第三方研究者能不能抓到这个被引用的 URL”,而不是“引用它的那个引擎能不能抓到”。失效模式都很平淡:登录墙、同意弹层、拦爬虫的 WAF 规则、内容其实是图片的页面、如今已 404 的 URL。每一条都是一张技术工单,不是一个内容决策。

关于访问,有两个反方向的错误认知。第一个是“付费墙能把你挡在 AI 答案之外”:一项覆盖 10 万条美国长尾新闻查询、采集于 2025 年 4 月的厂商研究发现,某大报在 AI Overviews 中被引用的内容有超过 96% 指向付费墙内容,因为 Google 的灵活抽样允许 Googlebot 进入付费墙之内。厂商发布;按本课程的出处规则,只描述、不链接。

第二个是“屏蔽爬虫能保护你不被摘要”。哥伦比亚大学 Tow 中心在 2025 年 10 月做了测试,发现智能体浏览器取回了一篇 9,000 词的仅限订阅者文章,而同样两个产品的标准界面却取不到,因为出版方屏蔽的是那些爬虫,而这些浏览器在服务器日志里与 Chrome 无法区分。在屏蔽确实生效的场合,智能体则“拼出了一份复合摘要,取材自关于该文的推文、转载版本、其他媒体的引用以及全网的相关报道”。6 屏蔽改变的是流量归谁,而不是把你从答案里移除。

爬虫令牌

robots.txt 里哪个令牌才真的会把你从 AI 答案里拿掉?

是搜索令牌,绝不是训练令牌,而且每家厂商都用自己的措辞把这个拆分写进了文档。

引擎训练令牌搜索令牌屏蔽训练会把你拿掉吗?
GoogleGoogle-ExtendedGooglebot不会。“Google-Extended 不影响站点在 Google 搜索中的收录”
OpenAIGPTBotOAI-SearchBot不会。站点可以放行 OAI-SearchBot 同时禁止 GPTBot
AnthropicClaudeBotClaude-SearchBot不会。独立令牌,分别有文档
AppleApplebot-ExtendedApplebot不会。“禁止 Applebot-Extended 的网页仍可被收入搜索结果”
Perplexity未公布PerplexityBot按其自身文档,Perplexity-User“通常会忽略 robots.txt 规则”

由此得出的规则很短:屏蔽训练令牌对你在 AI 答案中的出现毫无影响;屏蔽搜索令牌才会把你从那个引擎的答案里拿掉。两个方向的错误都很常见。一边禁止 GPTBot、一边指望留在 ChatGPT 的搜索结果里,等于什么也没做,因为那个界面用的是 OAI-SearchBot 抓取。一边禁止 Google-Extended、一边担心 AI Overviews,同样什么也没做,因为 AI Overviews 取用的是由 Googlebot 填充的搜索索引。1345

真正会悄悄咬人的是那条一刀切的规则。多年前为防采集写下的通配 Disallow,会一次性把所有 AI 搜索爬虫都拦在门外;这也正是那些“多少网站屏蔽了 AI 爬虫”的流行统计被高估的原因,因为那些计数里包含了从来就不是针对 AI 的通配规则。某边缘网络 2025 年度回顾的独立基础设施数据显示,2025 年全年 AI 机器人占 HTML 请求的 4.2%,Googlebot 为 4.5%,而由用户触发的抓取在这一年里增长超过十五倍。7 请把那四个令牌分别检查一遍,并且跳过 llms.txt:Google 的文档说搜索会忽略它。

真正的执行方

怎么核验你的服务器实际放进来的是哪些爬虫?

robots.txt 只是一个请求,真正执行的是你的服务器,而两者不一致的频率比谁都预想的要高。一条拦爬虫规则、一个限流策略,或者一条按地区屏蔽的规则,都可能把 robots.txt 明确放行的爬虫挡掉,而且没有任何地方会报告这件事,因为一次从未完成的抓取不会留下任何可供你发现缺失的展示记录。这道缝隙与上文那个 27.1% 属于同一类问题,而且与引擎内部的行为不同,它完全在你自己可以检查的范围内。

要查就查访问日志,而不是配置文件;要按地址核对,而不是按名字。上表里的每一家厂商都为此公布了机器可读的 IP 地址段。OpenAI 为 OAI-SearchBot、GPTBot 和 ChatGPT-User 各提供了一份 JSON 文件。3 Perplexity 为 PerplexityBot 和 Perplexity-User 各公布了一份,并让防火墙运维方以那些端点为准。5 Google 公布了 common-crawlers.json,以及针对特例爬虫和用户触发抓取器的独立文件,同时给出了手工做法:对发起抓取的地址做反向 DNS 查询,结果必须解析到 googlebot.com、google.com 或 googleusercontent.com,再用一次正向查询回到同一个地址。10

有两个结论值得据此行动。user-agent 字符串不是证据,所以按名字放行等于放行任何愿意发送那串字的东西,而按名字屏蔽也拦不住任何要紧的东西。另外,如果某个搜索令牌在一整周里都没有一次成功抓取,而页面确实在线且被放行,那么屏蔽就发生在 robots.txt 与你的源站之间,这是一张防火墙工单,而不是一张 SEO 工单。

渲染

AI 爬虫会执行你的 JavaScript 吗?

有些会,有些则两个方向都没有文档;而诚实的说法是:唯一已发表的测量来自 2024 年 12 月,它没有观察到执行。那次测量来自某基础设施提供商发文前一个月的第一方日志数据(文中的 5.69 亿次 GPTBot 与 3.7 亿次 ClaudeBot 是请求量,不是渲染测试的样本量,后者原文并未给出),结论是“目前没有一个主流 AI 爬虫会渲染 JavaScript”,同时指出这些爬虫确实会抓取 JavaScript 文件但不执行它们。8 此后既没有复现研究,也没有相反的测量发表;而 OpenAI、Anthropic 和 Perplexity 的爬虫文档在渲染问题上两个方向都只字未提。这份沉默本身就是发现。

有三方是有文档说明会渲染的。Google 写明它“能够处理 JavaScript 中的内容,只要它没有被屏蔽”,而 AI Overviews 与 AI Mode 跑在那个已渲染的索引之上。1 Apple 写明“Applebot 可能会在浏览器中渲染你网站的内容”,并警告若在 robots.txt 中屏蔽 JavaScript 与 CSS,“它可能无法正确渲染内容”。9 而这两家公司推出的智能体浏览器是完整的 Chromium 构建。任何“AI 看不到你的 JavaScript”的一刀切说法,对这一整类都是错的。

所以这是一个可以低成本消除的风险,而不是一场需要打赢的辩论。如果读者需要的正文就在初始 HTML 响应里,这个问题在任何引擎上都不会出现。同样的逻辑适用于 URL 卫生,而 2024 年 12 月那份数据在这点上格外直白:GPTBot 有 34.82% 的抓取花在 404 上、14.36% 花在跳转上,ClaudeBot 有 34.16% 花在 404 上,而 Googlebot 分别是 8.22% 和 1.49%。过期的 sitemap 和跳转链条,会烧掉 AI 爬虫比烧掉 Google 大得多的一部分注意力。

本页诚实的局限

JavaScript 那个结论是单一来源且已过时:只有 2024 年 12 月的一篇文章,其“如何检测执行”的方法另有一篇文章说明,用的是渲染时注入信标,属于单向测试:信标没回来,无法区分“不渲染”和“信标被拦截或超时”;而且此后二十个月没有任何复现。请把它当作现有最好的证据,而不是关于 2026 年的事实。27.1% 这个抓不下来的数字有一个更微妙的局限:它测的是“第三方研究者能否取回一个被引用的 URL”,这与“引用它的那个引擎能否取回”并不等同,因为引擎可能用的是缓存副本或自己的索引。两个数字在方向上都有用,但都不该被当成定律来引用。

产品在哪里派得上用场,在哪里派不上

这个主题请完全不用软件解决掉,清单就是一个下午的活:确认关键页面已被收录且有资格带摘要,以匿名客户端抓取每个页面、检查正文是否就在 HTML 响应里,把 robots.txt 里那四个搜索令牌分别读一遍,再清理内部链接仍指向的 404 与跳转链条。这些事 Bavior 一件都不做:没有爬虫、没有索引,也不做服务器技术审计。它做的事在这之后,等页面可被检索了,它按计划把一组固定 prompt 打到五个引擎上,记录每个答案引用了哪些来源。免费 GEO 审计能给你这个基线;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 29 日)。

出处,全部核查于 2026 年 8 月 29 日
  1. Google Search Central,《AI features and your website》(更新于 2025 年 12 月 10 日)及 AI 优化指引(更新于 2026 年 7 月 10 日)(第一方;收录要求、“无需特殊标记”的表述、llms.txt、JavaScript 处理):developers.google.com/search/docs/appearance/ai-featuresAI 优化指引。Google-Extended 的文档见 google-common-crawlers
  2. Allaham 与 Diakopoulos,2026 预印本;AI 答案中已被引用的 URL 有 27.1% 因不可访问、已被删除或非文本而未被抓取;成功取回的 19,154 个页面中约 16% 被标记为 AI 生成。经 2026 年批判性综述 §8.3 转引,arXiv:2607.14035:arxiv.org/abs/2607.14035
  3. OpenAI,爬虫文档(GPTBot、OAI-SearchBot、ChatGPT-User,以及各令牌的 IP 地址段文件):developers.openai.com/api/docs/bots
  4. Anthropic,《Does Anthropic crawl data from the web?》(ClaudeBot、Claude-SearchBot、Claude-User):support.claude.com/en/articles/8896518
  5. Perplexity,机器人文档(PerplexityBot、Perplexity-User,以及公布的 IP 地址段):docs.perplexity.ai/guides/bots
  6. 哥伦比亚大学 Tow 数字新闻中心,《How AI browsers sneak past blockers and paywalls》,2025 年 10 月 30 日:cjr.org
  7. Cloudflare Radar 2025 年度回顾,数据区间 2025 年 1 月 1 日至 12 月 2 日;AI 机器人占 HTML 请求 4.2%,Googlebot 为 4.5%,用户触发的抓取增长超过 15 倍:blog.cloudflare.com/radar-2025-year-in-review
  8. Vercel × MERJ,《The rise of the AI crawler》,2024 年 12 月 17 日;发文前一个月的第一方日志数据,5.69 亿次 GPTBot 与 3.7 亿次 ClaudeBot 抓取,未观察到 JavaScript 执行;404 与跳转占比:vercel.com/blog/the-rise-of-the-ai-crawler
  9. Apple,《About Applebot》(在浏览器中渲染;Applebot-Extended):support.apple.com/en-us/119829
  10. Google Search Central,《Verifying Googlebot and other Google crawlers》(反向与正向 DNS 核验;爬虫 IP 地址段 JSON 文件):developers.google.com/search/docs/crawling-indexing/verifying-googlebot
  11. 微软,《Add a public website as a knowledge source》,Copilot Studio,更新于 2026 年 7 月 21 日(需要登录或未被 Bing 收录的 URL 不受支持):learn.microsoft.com/en-us/microsoft-copilot-studio/knowledge-add-public-website
常见问题

你想知道的,都在这里。

想出现在 Google AI Overviews 里,需要做什么特别的事吗?

不需要,Google 直接写明:“出现在 AI Overviews 或 AI Mode 中没有额外要求,也不需要其他特殊优化。”唯一写明的要求是:“页面必须被收录,并且有资格带摘要出现在 Google 搜索中,满足搜索的技术要求。”同一份文档还说明,你不需要新建机器可读文件、AI 文本文件或标记,也没有需要额外添加的 schema.org 结构化数据。任何以“AI 专用标记”名义售卖的东西,都与引擎自己的文档相矛盾。

有没有一个“AI 索引”可以提交我的站点?

没有,也没有任何引擎公布过这样的提交端点。Google 的 AI Overviews 和 AI Mode 跑在搜索索引上,Gemini 使用 Googlebot 的基础设施;微软 Copilot Studio 的文档写明,需要登录才能访问、或未被 Bing 收录的 URL,不能作为公开网站知识源;OpenAI、Anthropic 和 Perplexity 各自公布了一个按常规方式抓取页面的搜索爬虫。你的页面进入这个池子的方式和过去完全一样:爬虫抓到它、索引留下它、检索环节选中它。如果有服务号称能做“AI 收录”,请问它把数据 POST 到哪个端点。

屏蔽 GPTBot 会把我从 ChatGPT 的答案里拿掉吗?

不会。GPTBot 是训练爬虫,而为搜索结果抓取页面的是 OAI-SearchBot。OpenAI 自己的文档写明:站长可以在放行 OAI-SearchBot 以便出现在搜索结果中的同时,禁止 GPTBot。同样的拆分在别处也存在:Google-Extended 对 Googlebot、ClaudeBot 对 Claude-SearchBot、Applebot-Extended 对 Applebot。Google 明确写道,“Google-Extended 不影响站点在 Google 搜索中的收录”。真正会一次性把你从所有 AI 搜索爬虫面前拿掉的,是一条一刀切的 Disallow 规则。

怎么确认打到我服务器上的爬虫真的是它自称的那一个?

用发起抓取的 IP 地址去比对厂商公布的地址段,永远不要凭 user-agent 字符串,因为任何人都能发送那串字。OpenAI 为 OAI-SearchBot、GPTBot 和 ChatGPT-User 各公布了一份地址段 JSON 文件;Perplexity 为 PerplexityBot 和 Perplexity-User 公布了地址段,并让防火墙运维方以那些端点为准;Google 公布了 common-crawlers.json,以及针对特例爬虫和用户触发抓取器的独立文件,同时给出反向 DNS 查询的做法:解析结果必须是 googlebot.com、google.com 或 googleusercontent.com,再用正向查询回到同一个地址加以确认。

AI 爬虫能读取靠 JavaScript 渲染的页面吗?

取决于引擎,而且证据比那些语气笃定的博客文章要薄得多。唯一已发表的测量,是某基础设施提供商 2024 年 12 月的日志研究,结论是主流 AI 爬虫都不渲染 JavaScript,尽管它们确实会去抓 JavaScript 文件。此后没有出现复现研究,而 OpenAI、Anthropic 和 Perplexity 在两个方向上都没有任何文档说明。Google 在未被屏蔽时会处理 JavaScript,Apple 的文档说明 Applebot 会在浏览器中渲染,而智能体浏览器本身就是 Chromium 构建,当然会执行它。

付费墙能把我的内容挡在 AI 答案之外吗?

不能,而且这个问题的两侧证据都指向相反方向。一项覆盖 10 万条美国长尾新闻查询、采集于 2025 年 4 月的厂商研究发现,某大报在 AI Overviews 中被引用的内容有超过 96% 指向付费墙内容,因为 Google 的灵活抽样允许 Googlebot 进入付费墙之内。而当爬虫真的被屏蔽时,Tow 中心 2025 年 10 月的测试发现,引擎会转而用转载副本、第三方报道和社交帖子拼出一份复合摘要。屏蔽改变的是流量归谁,而不是你会不会出现。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

先做到可检索,再谈可引用。
今天就把那四个令牌查一遍。

免费试用