首页/学习 GEO/AI 抓取流量
技术 GEO · 量级

真实的 AI 抓取流量长什么样?

这一篇不讲怎么读日志,而讲日志里的流量本身是什么:和传统搜索抓取相比它有多大、增长的是哪一部分、它抓的是什么,以及这些能支撑哪些容量决策。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

比报道给人的印象要小,而且增长发生在不改变任何答案的那一部分。在 2025 年的某个大型网络上,搜索引擎爬虫占已核验机器人流量的 40%,AI 爬虫是它的一半,20%,SEO 类机器人还占了超过 13%。1 真正有用的做法,是不再把 AI 抓取读成一条线,而是读成走向完全不同的三条曲线。

关键要点
  • 为模型训练而做的抓取占据了绝大部分体量,峰值可达搜索类抓取的 7 到 8 倍;而真正喂养引用的搜索侧抓取,2025 年收尾时比年初还低了将近 10%。
  • 它们抓的并不都是你的 HTML。在一个被测量的站点上,某个助手的抓取有 57.70% 是 HTML,另一个则有 35.17% 是图片,这让“带宽”这件事对每一家厂商都不是同一回事。
  • 全网平均值对你的站点是很弱的先验:仅零售与计算机软件两个行业,在 2025 年 10 月就吸走了略超过 40% 的 AI 抓取活动。
  • 总体份额本身在一年之内就从 2.4% 摆到 6.4%,所以你自己日志里同样幅度的波动,可能是大盘在动,而不是你上线了什么。
绝对量级

和传统搜索抓取相比,AI 抓取有多大?

在唯一一个大到能公布这个对比的网络上,大约是它的一半,而且集中在少数几个 user-agent 上,并不是撒在一大片长尾里。

Cloudflare 的 2025 年度回顾覆盖 2025 年 1 月 1 日至 12 月 2 日、其整个网络,给出的数字是:搜索引擎爬虫占全年已核验机器人流量的 40%,AI 爬虫是它的一半,20%。1 在这两个类别内部,分布是极度集中而不是长尾的:仅 Googlebot 一家就贡献了超过 28% 的已核验机器人流量,OpenAI 的 GPTBot 约 7.5%,微软的 Bingbot 6%。1 被描述成“爬虫大军”的东西,大部分是由四个 user-agent 扛着的。

只统计 HTML,也就是真正承载你内容的那部分流量,画面会进一步收紧。2025 年全年,除 Googlebot 之外的 AI 机器人在该网络上平均占 HTML 请求的 4.2%,而 Googlebot 一家占 4.5%;截至 12 月 2 日,人类产生了 47% 的 HTML 请求,非 AI 机器人产生 44%。1 十次 HTML 请求里,有九次以上和 AI 爬虫毫无关系。某托管平台 2024 年底一个月的自有日志,用另一条路径得到了同样的形状:两个最大的 AI 爬虫加起来,约为同期 Googlebot 抓取量的 20%。3

有一条限定条件必须跟着这里每一个数字走。Googlebot 和 Bingbot 同时为搜索索引和 AI 训练而抓取,所以把它们算进“搜索”桶还是“AI”桶,是一个标注决定,而不是关于数据包的事实。Cloudflare 两边都算,这也是为什么它的 AI 爬虫总览里排在最前面的,是一个多数人不会称之为 AI 爬虫的机器人。1

增长

真正增长的是 AI 抓取的哪一部分?

Cloudflare 按声明的用途给 AI 抓取分类:训练,即为了构建模型而收集内容;搜索,即构建答案所依托的索引,也可能包含检索增强生成;以及用户触发,即因为有人刚刚问了助手一个问题而发生的抓取。第四个桶装的是用途未声明或不明的爬虫。1 这三个已声明的类别在 2025 年走出了三个不同的方向,而这个分化就是全部结论。

训练类主导了体量,峰值时可达搜索类抓取的 7 到 8 倍、用户触发类的 32 倍。1 用户触发类增长最快:它年初是三类里最小的,在 1 月和 2 月里翻了一倍多,3 月初又翻一倍,此后一路上行。Cloudflare 自己给这条曲线的小标题写的是“2025 年增长超过 15 倍”,而紧挨着的正文写的是“从 1 月到 12 月初增长超过 21 倍”。1 该文并未把两者对齐,所以值得引用的是更保守的那个数字,而这个不一致本身也值得知道。

搜索类抓取是没人拿去做标题的那条曲线,却是引用真正依赖的那一条。它在 3 月中之前最强,随后下降了约 40%,之后缓慢恢复,到统计区间结束时比年初低了将近 10%。1 单个爬虫的分化同样剧烈:OAI-SearchBot 在 10 月底冲高到约为 1 月的 5 倍,PerplexityBot 收尾时约为年初的 3.5 倍,ClaudeBot 上半年基本翻倍、下半年回落到比年初高约 10%,而 GPTBot 在 6 月见顶,11 月收尾时只比年初略高。1 哪个令牌属于哪一类用途,各家厂商都有文档,也在读日志那一篇里列成了表。456

构成

AI 爬虫的流量里有多少是你的 HTML?

并不全是,而且各家之间的差别大到足以改变“屏蔽其中某一家能省下什么”的答案。Vercel 与 MERJ 测量了 AI 爬虫在 nextjs.org 上抓取的内容类型,发现 ChatGPT 的抓取有 57.70% 是 HTML,而 Claude 有 35.17% 是图片;两者还各有一部分花在它们并不执行的 JavaScript 文件上,分别是 11.50% 和 23.84%。3 Googlebot 跨 Gemini 与搜索的抓取则又是另一种分布:31.00% HTML、29.34% JSON、20.77% 纯文本、15.25% JavaScript。3

对容量来说有两点推论。“AI 爬虫在吃我的带宽”这句话对每一家厂商都不是同一句话,因为其中一家主要是在从你的源站拉文档,另一家主要是在拉图片,这两者落在你账单的不同行上。而一个去抓自己从不执行的脚本包的爬虫,是在买它读不懂的字节,所以这一部分是资源与缓存问题,不是内容问题。至于它们到底会不会执行 JavaScript,那是另外一个问题

这里的样本必须明说,因为内容类型构成正是那种最经不起搬运的统计量。那些百分比来自 2024 年年底一个月里、一个以文档为主的站点、一套框架,而在此后的二十个月里没有任何复现被发表。一个图片很重的媒体站,或者一个商品目录庞大的商店,都不会看到那样的分布。在照抄别人的分布来做规划之前,先从你自己的边缘日志里拉一份同样的拆分。

成本

这些流量到底花了你多少成本?

比围绕它的争论所假设的要少,而且一次查询比一场会议更快给出答案。按全网平均,除 Googlebot 之外的 AI 机器人大约占每二十四次 HTML 请求中的一次。1 一个每月承载十万次 HTML 请求的站点,对应大约四千次抓取,这在任何现代技术栈上都算不上一次容量事件。一个正在权衡要不要屏蔽的团队,更值得先把一个月的边缘日志按 user-agent 类别、状态码和响应字节分组,因为这个数字要么大到足以支撑后面的讨论,要么不。

成本真正咬人的地方,比“流量”这个词所暗示的要窄。它集中在没有命中缓存、一路打到你应用上的 HTML,集中在那个主要想要图片的爬虫带来的图片出网流量,以及集中在被你的框架动态渲染、而不是从边缘直接返回的错误页上。这三件事都是缓存与资源决策,都同时让真人访客受益,而且都比一场策略之争便宜。

全网平均值对任何一个具体站点也都是很弱的先验。2025 年 10 月,零售与计算机软件两个行业合计吸走了略超过 40% 的 AI 抓取活动,前十个行业合计接近 70%。1 按地区看,Googlebot 在 Cloudflare 测量到的每一个地区都占据爬虫流量的 35% 到 55%,GPTBot 或 Bingbot 以 13% 到 14% 位居第二。1 一个软件文档站和一个本地服务站,并不来自同一个分布,而平均值也不是它们中的任何一个。

基线

你自己的抓取流量,什么时候才算真的变了?

比一张图看上去的次数要少,因为基线本身在动。在一个由数百万站点组成的网络上,AI 占 HTML 请求的总体份额在同一年里,从 4 月初的 2.4% 一路摆到 6 月底的 6.4%,两倍半以上的摆幅,而没有任何一个站点做了什么。1 所以你自己的抓取曲线在一个季度里翻倍,完全可能只是大盘在你脚下移动;要把它归因于你上线的某件事,需要的是那次比对,而不只是那条曲线。年度回顾所依据的 Radar 实时曲线是公开的,做这次比对不花钱。2

另有两个常见且很容易避免的读法错误。把 AI 机器人汇总成一条线,会掩盖上一节里的分化:三个具名爬虫在同一年里分别收在约 3.5 倍、1.1 倍和基本持平。而一条包含双重用途 Googlebot 的汇总曲线,和一条不包含它的曲线,是两条不同的曲线,差距大约就是它自己那么大;所以两张互相矛盾的图,可能只是在统计不同的人群。1

在你自己的量级上,一次计数变动算不算真实,是另一个统计问题、有另一个答案,读爬虫日志那一篇把它推演过一遍。这里的问题排在它前面:一个变化完全可以在统计上是真的,同时又根本不是关于你的站点的。

决策

这些数据该改变什么,又不该改变什么?

有三个决策会因为这些数据变得更好,有一个会变得更糟。它应该改变你怎么做容量预算:把 HTML 缓存在边缘、提供尺寸合适的图片、让错误页从边缘返回而不是从应用返回,这样抓取就被吸收掉了,谁都不必去动 robots.txt。它应该让你更清楚地读自己的令牌策略,因为训练类抓取花掉你的字节、在答案侧什么都不返还,而搜索侧抓取才是引用所依赖的那一类。它还应该重置预期,因为抓取量的一次冲高是输入,不是结果。

它不该改变的,是你对可见度的任何断言。目前没有任何公开研究把单站点的抓取量和单站点的引用率连起来,这两份数据也没有共同的标识符,所以抓取增长并不构成“下游有任何改善”的证据。至于要不要给这些流量加闸或屏蔽,是另一个建立在另一批证据上的决策,由付费墙与爬虫屏蔽那一篇接手。

本文诚实的边界

这里几乎每一个数字都来自两家厂商对自己网络的报告,一家是内容分发网络,一家是托管平台,而两个样本都不是“整个网络”。内容类型的百分比来自 2024 年年底的单个站点,此后没有被复现过。2025 年的各项份额截止到 2025 年 12 月 2 日,而爬虫的构成此后已经变了。所有这些都没有对照引用结果做过验证,因为没有任何公开研究把单站点的抓取行为和单站点的引用率连起来。请把它们全部读成一个“大致合理的区间”,把你自己的边缘日志当作真正的测量。

产品能做什么,不能做什么

这一页上的所有内容,都是对你已经拥有的日志做一次查询:把一个月的边缘请求按 user-agent 类别、状态码和字节数分组,你就得到了自己那份 AI 抓取流量的形状,一分钱都不用花。Bavior 做的是答案那一侧的事:按计划在五个引擎上跑一组固定的 prompt 面板,记录每个答案引用了哪些来源。Bavior 不做的,是读你的访问日志、统计爬虫字节、给你的缓存定容量,或者告诉你某次抓取增长导致了某个引用;最后这一件谁也做不到,因为抓取侧和答案侧没有共同的标识符。免费可见度检查免费 GEO 审计无需付费方案即可使用;付费方案按月为 $99/月,按年为 $79.17/月(截至 2026 年 8 月 30 日)。

出处,全部核验于 2026 年 8 月 30 日
  1. Cloudflare Radar 2025 年度回顾,数据区间 2025 年 1 月 1 日至 12 月 2 日;已核验机器人的类别份额、各机器人份额、用途分类及其走势、HTML 请求份额、robots.txt 指令构成、2025 年 10 月按地区与行业的抓取分布:blog.cloudflare.com/radar-2025-year-in-review
  2. Cloudflare Radar,AI Insights(年度回顾背后的实时曲线,含机器人最佳实践与 robots.txt 中出现的 AI user-agent):radar.cloudflare.com/ai-insights
  3. Zecchini、Moore、Ubl、Siddle,《The rise of the AI crawler》,Vercel 与 MERJ,2024 年 12 月 17 日;来自 nextjs.org 与 Vercel 网络该采样月的第一方日志数据;各爬虫的内容类型占比与相对抓取量:vercel.com/blog/the-rise-of-the-ai-crawler
  4. OpenAI,爬虫与机器人文档(GPTBot 用于训练、OAI-SearchBot 用于搜索、ChatGPT-User 用于用户触发的抓取;第一方):developers.openai.com/api/docs/bots
  5. Anthropic,《Does Anthropic crawl data from the web?》(ClaudeBot、Claude-SearchBot、Claude-User;第一方):support.claude.com/en/articles/8896518
  6. Google 搜索中心,《Google user-triggered fetchers》(把用户触发型抓取器单列为一个有文档的类别;第一方):developers.google.com/crawling/docs/crawlers-fetchers/google-user-triggered-fetchers
  7. Perplexity,机器人文档(PerplexityBot 与 Perplexity-User;第一方):docs.perplexity.ai/guides/bots
常见问题

你想知道的,都在这里。

AI 爬虫的流量已经超过 Googlebot 了吗?

没有,至少在唯一一个大到能公布这个对比的网络上没有。在 2025 年,Cloudflare 给出的数字是:搜索引擎爬虫占已核验机器人流量的 40%,AI 爬虫是它的一半,20%。只统计 HTML 请求时,除 Googlebot 之外的 AI 机器人平均占 4.2%,而 Googlebot 一家就占 4.5%。AI 抓取是真实的、也在增长,但它的量级大致相当于 Googlebot,而不是它的若干倍。

2025 年增长的是哪一类 AI 抓取?

增长的是训练类和用户触发类抓取,搜索类没有增长。Cloudflare 的报告显示,训练类占据 AI 爬虫流量的绝大多数,峰值时可达搜索类抓取的 7 到 8 倍,而用户触发类全年增长超过 15 倍。搜索类抓取,也就是构建答案所依托索引的那一类,在统计区间结束时比年初还低了将近 10%。那个被拿去做标题的增长,并不来自产生引用的那一类。

AI 爬虫只抓 HTML 页面吗?

不是,而且各家的构成差别很大。在一个被测量的站点上,ChatGPT 的抓取有 57.70% 是 HTML,而 Claude 有 35.17% 是图片;两者还分别把 11.50% 和 23.84% 花在它们并不执行的 JavaScript 文件上。Googlebot 跨 Gemini 与搜索的抓取则分布得更均匀:31.00% HTML、29.34% JSON、20.77% 纯文本、15.25% JavaScript。所以“带宽被吃掉了”这句抱怨,对不同爬虫指的并不是同一件事。

AI 抓取流量的成本高到值得屏蔽吗?

单看流量通常不值得,而且只要一次查询就能确认。按全网平均,除 Googlebot 之外的 AI 机器人大约占每二十四次 HTML 请求中的一次;也就是说,一个每月承载十万次 HTML 请求的站点,大约会收到四千次 AI 抓取。请先把自己一个月的边缘日志按 user-agent 类别和响应字节分组,再做决定。缓存、尺寸合适的图片、以及在边缘直接返回错误页,通常就把这件事解决了。

我这个季度的 AI 抓取量翻倍了,是我的站点变了吗?

可能不是,因为基线本身就在动。在一个由数百万站点组成的网络上,AI 占 HTML 请求的总体份额在同一年里从 2.4% 波动到 6.4%,两倍半以上的摆幅,而这不是任何单个站点造成的。在把变化归因于你上线的某件事之前,请先拿你的曲线去和一条公开的全网曲线比对,并且按爬虫分开看,而不是读一条汇总起来的线。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

这些流量比围绕它的争论要小得多。
先量一量,再做任何决定。

免费试用