首页/学习 GEO/读爬虫日志
衡量 AI 可见度 · 爬虫那一侧

GEO 里该怎么读 AI 爬虫日志?

答案侧的采样告诉你结果,服务器日志告诉你输入到底有没有送达。整套分析就是一个过滤、三个问题、一个核验步骤,按这个顺序,因为顺序正是让你不去读噪声的东西。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

按 user-agent 令牌过滤访问日志,把搜索侧、训练侧和用户触发型这三类分开,永远不要把它们汇总成一条曲线。然后按顺序读三件事:按令牌统计的错误率、你意图最高的那些页面到底有没有被抓过,以及用户触发型抓取器落在了哪里。先看错误,是因为它通常是最大的一笔损失:在某基础设施服务商 2024 年 12 月的日志研究里,GPTBot 有 34.82% 的抓取打在 404 上,而 Googlebot 是 8.22%。6

关键要点
  • 要分三类而不是两类:搜索侧令牌(OAI-SearchBot、Claude-SearchBot、PerplexityBot、Applebot、Googlebot)、训练侧令牌(GPTBot、ClaudeBot、Google-Extended、Applebot-Extended),以及用户触发型抓取器(ChatGPT-User、Claude-User、Perplexity-User、Google-Agent)。每一组拆分都由厂商自己在文档里写明。
  • 先修被浪费的抓取:把你自己的 404 按抓取次数排序,就能得到一份排好序的失效内链与过期站点地图条目清单。
  • 一个“零”胜过一个百分比。一个高意图页面 30 天内没有任何一次成功的搜索侧抓取,是真实的发现;而计数从 12 掉到 7 只是噪声。
  • user-agent 头是自我声明的,所以在你信任这一切之前,请先拿厂商公布的地址段核验它。
过滤

哪些 user-agent 令牌该分开统计?

要分三类而不是两类:构建答案所依托索引的搜索侧爬虫、通常对答案没有影响的训练侧爬虫(Google-Extended 除外,它同时控制 Gemini Apps 的接地),以及在有人提问的那一刻到达的用户触发型抓取器。

每家主要厂商都自己在文档里写明了这个拆分,所以下表是第一方信息而不是推测。第三列是多数日志报告会略去的一列。

厂商搜索侧令牌训练侧令牌用户触发型抓取器
OpenAIOAI-SearchBotGPTBotChatGPT-User1
AnthropicClaude-SearchBotClaudeBotClaude-User2
PerplexityPerplexityBot文档中没有Perplexity-User3
AppleApplebotApplebot-Extended文档中没有4
GoogleGooglebotGoogle-Extended5Google-Agent10

把这三类汇总成一条“AI 机器人”曲线,是让一份日志报告变得毫无用处的那个错误,因为这三类回答的是不同的问题。搜索侧抓取下降,是一个你这周就该修的检索问题。训练侧抓取下降,对多数答案面都不意味着什么,但 Google-Extended 是个例外,它同时控制 Gemini Apps 的接地。而用户触发型抓取上升,根本不是维护信号:那是有人此刻正在问起你,是这个领域能提供的、最接近需求数据的东西。

请拿厂商文档去核对这张表,而不是拿某篇博客(包括本文)去核对,因为令牌清单是会变的。OpenAI 现在文档里有了第四个令牌 OAI-AdsBot,用于校验被提交为广告的页面;1 Google 把“用户触发型抓取器”单列为一个文档类别,其中包含 Google-Agent,而原先的 Google-NotebookLM 被标注为只支持到 2026 年 8 月,由 Google-GeminiNotebook 接替。10 至于该放行哪个令牌、屏蔽某一个到底会造成什么,是技术 GEO这一阶段 的主题;本页假设令牌都已放行,只问这些流量在告诉你什么。

三个问题

按顺序该看哪三件事?

先看被浪费的抓取,再看缺失的覆盖,最后看需求,因为这正是它们可被修复的先后次序。每一件都是在同一份过滤后的日志上做一次聚合,而且没有一件需要超出“你现有的日志查询工具”的东西。

第一:按令牌统计的状态码构成。按令牌和状态码类别分组,分别读每个令牌的 2xx、3xx、4xx 占比。AI 爬虫跟随站点结构的能力明显差于 Googlebot。某基础设施服务商 2024 年 12 月的日志研究(采样月份内覆盖 5.69 亿次 GPTBot 与 3.70 亿次 ClaudeBot 抓取)发现,GPTBot 有 34.82% 的抓取打在 404 上、14.36% 打在跳转上,ClaudeBot 有 34.16% 打在 404 上;Googlebot 对应的是 8.22% 与 1.49%。6 可执行的部分在那个百分比底下的 URL 清单:把你自己的 404 按抓取次数排序,你就得到一份排好序的失效内链与过期站点地图条目清单。

第二:你意图最高的那些页面的覆盖情况。把那十到二十个“能回答购买问题”的 URL 写下来,也就是定价、对比、集成、安全,以及那些针对具体异议的页面,然后逐一去日志里查:过去 30 天里有没有一次成功的搜索侧抓取。没人检索的页面不可能被引用,所以这里的一个“零”,比答案侧的任何比率都更有分量。有两种失败形态反复出现:只被某一家厂商的搜索令牌抓到、其他都没有,这通常指向 robots.txt 或渲染上的差异;以及几个月前被抓过一次、此后再没回访,这通常指向指向它的内链太弱。

第三:用户触发型的到达。把 ChatGPT-User、Claude-User、Perplexity-User 分开,按天、按路径统计。它们不按爬取计划运行;它们出现,是因为有人问了一个问题、而助手跑去看了一眼。请把它们读作“收到它们的那些具体页面上的需求信号”,并留意有没有新路径冒出来:一个对比页开始收到用户触发型抓取,说明关于你的选型对话正在发生。Cloudflare 全网 2025 年度回顾报告,用户触发型抓取在这一年里增长超过十五倍。7

量级参照

该预期多大的量,以及什么时候变化才算真的?

你该预期 AI 爬虫在你站点上的体量与 Googlebot 相当,而不是它的若干倍;也该预期你自己的多数计数小到不足以画趋势。Cloudflare 2025 年度回顾(数据区间 2025 年 1 月 1 日至 12 月 2 日、覆盖其全网)把 AI 机器人定在全年 HTML 请求的 4.2%,Googlebot 为 4.5%。7 同一份 2024 年 12 月的日志研究给出的月度抓取量是:Googlebot 45 亿次,GPTBot 5.69 亿次,ClaudeBot 3.70 亿次,Applebot 3.14 亿次,PerplexityBot 2,440 万次。6 把这些比例套到你自己的 Googlebot 流量上,你就有了一个粗略预期。

比基准值更要紧的是那个统计学要点,而它正是日志报告最常搞错的地方。单个站点上的抓取计数是小数字,而小计数的噪声会被百分比掩盖。如果某个搜索侧令牌上周抓了 12 个页面、这周抓了 7 个,那不是“下降 42%”;对这么小的计数来说,仅仅是普通的泊松波动就大致覆盖了这个范围,而从中读出趋势就是一个错误。由此得出规则:比较计数之前先聚合到至少一个月,并把一个周期内低于约 30 次的抓取计数当作“有/无”的观察,而不是一个数量。《统计功效》那一篇在答案侧推演的是同一个问题。

引荐

“抓取对引荐比”告诉了你什么?

它告诉你的是:一个平台从你站点拿走了多少,又送回来了多少,而这两半本来就在同一份访问日志里。Cloudflare 的算法是,把来自某平台爬虫 user-agent 的 HTML 请求数,除以 Referer 头指向该平台的 HTML 请求数。11 你可以自己算同一个量:一边是爬虫抓取次数,另一边是带着 chatgpt.com、perplexity.ai、claude.ai 或 gemini.google.com 引荐来源到达的会话。

全网口径下,这个比值是严重失衡的,而且平台之间相差好几个数量级。在 2025 年,Cloudflare 给出的是:Anthropic 在 5 月之后处于 25,000:1 到 100,000:1 的区间,更早还出现过高至 500,000:1 的峰值;OpenAI 起伏很大,3 月前后峰值约 3,700:1;Perplexity 一般低于 400:1;Google 则略高于 3:1,4 月一度到过 30:1,随后回落。7 在读你自己的数字之前有两点提醒。引荐那一侧会被低估,因为浏览器并不总会发送 Referer 头、某些客户端还会把它剥掉,所以你量到的比值是一个上限。以及,比值高本身不构成判决:它描述的是一个兑换率,而不是“被抓取到底值不值”;对一个以被引用而非被点击为目标的站点来说,点击从来就不是它索要的那笔报酬。

核验

你怎么知道那个机器人真是它自称的那个?

在你去核对它来自哪个地址之前,你并不知道,因为 user-agent 字符串是一个任何东西都能发送的自我声明的头部。核验是把一条日志变成证据的那一步:把来源地址与厂商公布的爬虫地址段做匹配,或者做一次反向 DNS 查询、再对结果做一次正向查询。OpenAI 为每个令牌各发布一份地址文件,Anthropic 用一份文件覆盖它的三个爬虫,Apple 和 Perplexity 也各自公布了自己的,1234 所以把这件事一次性做成过滤规则,比事后当成一次调查来做便宜得多。

值得费这个事,是因为“未声明的抓取”是一场进行中的争议,而不是一个假想。Cloudflare 于 2025 年 8 月 4 日发布分析称:它注册了全新的、从未被收录过的域名,并用 robots.txt 禁止一切抓取,而某个助手仍然返回了关于这些域名的详细内容;它把这些流量归因于一个通用浏览器 user-agent,来自该厂商公布地址段之外的地址,并取消了该厂商的“已验证机器人”资格。8 该厂商次日发布反驳,否认存在隐蔽抓取,并把这些请求归因于一家第三方云浏览器服务。这场分歧至今没有公开解决。请把它当作“去做核验”的理由,而不是关于某一家公司的定论。

边界

服务器日志告诉不了你什么?

日志无法告诉你某次抓取有没有变成一次引用,而正是这个缺口让答案侧的面板依然必要。一个页面可以每周都被搜索侧爬虫抓取却什么都没被引用;一个页面也可以从几个月前建好的索引里被引用,而近期完全没有被抓过。请把这两份数据按时间对齐、并排着读,并且忍住那句因果句,因为“爬虫回来了,然后我们开始出现了”是一个先后顺序,不是一个机制。

还有三个盲点值得点名。智能体浏览器在你的日志里与一次普通浏览器会话无法区分:哥伦比亚大学 Tow 数字新闻中心 2025 年 10 月 30 日发布的分析发现,它们取到了同一批厂商的标准界面取不到的订阅专享内容,恰恰是因为请求里没有任何东西把它们标记为自动化的。9 CDN 或边缘缓存会把抓取整个挡在源站日志之外,所以如果你有边缘日志就在边缘读,并且要预期只看源站的数字会低估。以及,一个令牌不再出现是有歧义的:它可能被屏蔽了、被改名了,也可能只是没有新东西可抓。

日志确实给你的,是这个领域里唯一的第一方证据。答案侧的一切都是从别人的系统里抽样来的,这让访问日志成为开始一次调查的正确地方,尽管它是结束一次调查的错误地方。

本文的诚实边界

这里的量化锚点,都比它们看上去更旧、更窄。34.82% 和 34.16% 的错误率来自某基础设施服务商 2024 年 12 月对自己网络的一份日志研究,此后二十个月无人复现;这些爬虫在这段时间里肯定变过,而真正主宰你站点的数字是你自己的错误率。Cloudflare Radar 的占比和抓取对引荐比都是全网口径,而一个文档为主的站点和一个新闻站点看到的构成相当不同。请把这两者读作“什么算合理”的量级参照,而把你自己的日志当作测量。本页所写的一切都没有对着引用结果被验证过,因为没有任何已发表的研究把单站点的抓取行为与单站点的引用率连起来。

产品在哪里派得上用场,在哪里派不上

这一切都是免费的,而且本来就是你的:按 user-agent 令牌过滤访问日志、按状态码类别分组、逐一检查你意图最高的那二十个 URL 有没有成功的搜索侧抓取、按天统计用户触发型抓取器,再拿厂商公布的地址段核验来源地址。Bavior 做的是同一个问题的另一侧:它按计划把固定 prompt 面板打到五个引擎上,并记录每条答案引用了哪些来源,这就是告诉你“一次抓取侧的修复有没有改变出现的是谁”的东西。它不做的事情是:读你的服务器日志、核验爬虫地址、修你的 404,或者告诉你某一次抓取变成了某一条引用,而最后这件事没有人做得到,因为这两份数据没有共同的标识符。免费可见性检测免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 29 日)。

出处,全部核查于 2026 年 8 月 30 日
  1. OpenAI,爬虫与机器人文档(GPTBot、OAI-SearchBot、OAI-AdsBot、ChatGPT-User,每个令牌各有一份公布的地址文件;第一方):developers.openai.com/api/docs/bots
  2. Anthropic,《Does Anthropic crawl data from the web?》(ClaudeBot、Claude-SearchBot、Claude-User,含公布的地址段;第一方):support.claude.com/en/articles/8896518
  3. Perplexity,机器人文档(PerplexityBot、Perplexity-User,含公布的地址段;文档写明 Perplexity-User“通常忽略 robots.txt 规则”;第一方):docs.perplexity.ai/guides/bots
  4. Apple,《About Applebot》(Applebot、Applebot-Extended、公布的 CIDR 文件、浏览器渲染;第一方):support.apple.com/en-us/119829
  5. Google Search Central,《AI features and your website》(Googlebot、Google-Extended、收录与摘要准入条件;第一方):developers.google.com/search/docs/appearance/ai-features
  6. Zecchini、Moore、Ubl、Siddle,《The rise of the AI crawler》,Vercel,2024 年 12 月 17 日;第一方网络日志数据,采样月份内 5.69 亿次 GPTBot 与 3.70 亿次 ClaudeBot 抓取;按令牌的 404 与跳转占比:vercel.com/blog/the-rise-of-the-ai-crawler
  7. Cloudflare Radar 2025 年度回顾,数据区间 2025 年 1 月 1 日至 12 月 2 日;AI 机器人占 HTML 请求 4.2%,Googlebot 占 4.5%,用户触发型抓取增长超过 15 倍,并按平台给出抓取对引荐比:blog.cloudflare.com/radar-2025-year-in-review
  8. Cloudflare,《Perplexity is using stealth, undeclared crawlers to evade website no-crawl directives》,2025 年 8 月 4 日(基础设施第一方;该厂商已于 2025 年 8 月 5 日发布反驳,否认存在隐蔽抓取):blog.cloudflare.com
  9. 哥伦比亚大学 Tow 数字新闻中心,《How AI browsers sneak past blockers and paywalls》,2025 年 10 月 30 日;智能体浏览器在日志里与普通浏览器会话无法区分:cjr.org
  10. Google Search Central,《Google user-triggered fetchers》(Google-Agent、Google-GeminiNotebook,Google-NotebookLM 仅支持到 2026 年 8 月;这些抓取器通常忽略 robots.txt;第一方):developers.google.com/crawling/docs/crawlers-fetchers/google-user-triggered-fetchers
  11. Cloudflare,《The crawl before the fall… of referrals》,2025 年 7 月 1 日;把“抓取对引荐比”定义为:来自某平台爬虫 user-agent 的 HTML 请求数,除以 Referer 头指向该平台的 HTML 请求数:blog.cloudflare.com/ai-search-crawl-refer-ratio-on-radar
常见问题

你想知道的,都在这里。

我该在服务器日志里找哪些 AI 爬虫令牌?

请分成三类而不是两类。搜索侧令牌构建的是答案所依托的索引:OAI-SearchBot、Claude-SearchBot、PerplexityBot、Applebot 和 Googlebot,这些才是对“是否被引用”要紧的。训练侧令牌,也就是 GPTBot、ClaudeBot、Google-Extended、Applebot-Extended,对任何答案都没有影响。用户触发型抓取器,也就是 ChatGPT-User、Claude-User、Perplexity-User 和 Google-Agent,是因为有人刚刚问了一个问题才来的,所以它们是需求信号而不是维护信号。以上每一组拆分都由厂商自己在文档里写明,所以这是一套第一方的分类,而不是推测出来的。

我的 AI 爬虫抓取次数上周从 12 掉到 7,要担心吗?

不用,因为这么小的计数本身带的波动,比你在看的这个变化还大。每周十来次抓取时,仅仅是普通的随机波动就覆盖了这个范围,所以从中读出“下降 42%”,和在几次 prompt 运行上画一根周环比箭头是同一类错误。请先聚合到月再比较计数,并把一个周期内低于约 30 次的抓取计数当作“有/无”的观察,而不是一个数量。在小体量下真正值得行动的是“零”:一个高意图页面在 30 天内没有任何一次成功的搜索侧抓取,在任何规模的站点上都是一个真实的发现。

日志里的 user-agent 字符串可信吗?

单靠它不可信,因为 user-agent 是一个任何东西都能发送的自我声明的头部。请拿源地址去核验:对照厂商公布的爬虫地址段,或者做一次反向 DNS 查询、再对结果做一次正向查询。OpenAI、Anthropic、Perplexity 和 Apple 都在各自的机器人文档里公布了地址文件,而把这项检查一次性做成过滤规则,远比事后当成一次调查来做便宜。这不是假想问题。Cloudflare 在 2025 年 8 月发布过一份分析,指称有来自某厂商公布地址段之外的未声明抓取,该厂商次日予以否认,而这场分歧至今没有公开解决。

服务器日志能告诉我某次抓取有没有带来引用吗?

不能,别的东西也不能,因为这两份数据没有共同的标识符。一个页面可以每周都被搜索侧爬虫抓取却从不被引用;一个页面也可以从几个月前建好的索引里被引用,而近期完全没有被抓过。请把日志侧和答案侧按时间对齐、并排着读,并且在因果句之前停住,因为“爬虫回来了,然后我们开始出现了”描述的是先后顺序,不是机制。日志是你手上关于“什么东西到达了你的服务器”的最强第一方证据,这让它成为开始一次调查的正确地方,以及结束一次调查的错误地方。

AI 平台的“抓取对引荐比”多少算正常?

没有“正常”,平台之间的巨大差距本身就是结论。在 2025 年,Cloudflare 给出的全网口径是:Anthropic 在 5 月之后处于 25,000:1 到 100,000:1 的区间,OpenAI 在 3 月前后的峰值约为 3,700:1,Perplexity 一般低于 400:1,Google 则略高于 3:1。你可以自己算:把每个平台的爬虫抓取次数,除以带着该平台引荐来源到达的会话数,然后把它读成一个兑换率,而不是一个判决。你的引荐那一侧会被低估,因为浏览器并不总会发送 Referer 头,所以请把算出来的数字当作上限。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

日志是你唯一的第一方证据。
请按正确的顺序去读它。

免费试用