首頁/學習 GEO/AI 抓取流量
技術 GEO · 量級

真實的 AI 抓取流量長什麼樣?

這一篇不講怎麼讀日誌,而講日誌裡的流量本身是什麼:和傳統搜尋抓取相比它有多大、成長的是哪一部分、它抓的是什麼,以及這些能支撐哪些容量決策。

本頁內容
分享本文
分享到 X 分享到 LinkedIn
簡短回答

比報導給人的印象要小,而且成長發生在不改變任何答案的那一部分。在 2025 年的某個大型網路上,搜尋引擎爬蟲佔已核驗機器人流量的 40%,AI 爬蟲是它的一半,20%,而搜尋引擎優化機器人超過 13%。1 真正有用的做法,是不再把 AI 抓取讀成一條線,而是讀成走向三個不同方向的三條曲線。

關鍵要點
  • 為模型訓練而做的抓取佔據了絕大部分體量,峰值可達搜尋類抓取的 7 到 8 倍;而真正餵養引用的搜尋側抓取,2025 年收尾時比年初低了將近 10%。
  • 它們抓的並不都是你的 HTML。在一個被測量的站點上,某個助手的抓取有 57.70% 是 HTML,另一個則有 35.17% 是圖片,這讓頻寬抱怨對每一家廠商都變成不同的抱怨。
  • 全網平均值對你的站點是很弱的先驗:僅零售與電腦軟體兩個產業,在 2025 年 10 月就吸走了略超過 40% 的 AI 爬蟲活動。
  • 總體份額本身在一年之內就從 2.4% 擺到 6.4%,所以你自己日誌裡同樣幅度的擺動,可能是大盤在動,而不是你上線了什麼。
絕對量級

和傳統搜尋抓取相比,AI 抓取有多大?

在唯一一個大到能公布這個對比的網路上,大約是它的一半,而且集中在少數幾個 user-agent 上,而不是分散在一整片領域裡。

Cloudflare 的 2025 年度回顧涵蓋 2025 年 1 月 1 日至 12 月 2 日、其整個網路,給出的數字是:搜尋引擎爬蟲佔全年已核驗機器人流量的 40%,AI 爬蟲是它的一半,20%。1 在這兩個類別內部,分佈是極度集中而不是長尾的:僅 Googlebot 一家就貢獻了超過 28% 的已核驗機器人流量,OpenAI 的 GPTBot 約 7.5%,Microsoft 的 Bingbot 6%。1 被描述成一支爬蟲大軍的東西,大部分是由四個 user-agent 扛著的。

只統計 HTML,也就是真正承載你內容的那部分流量,畫面會進一步收緊。2025 年全年,除 Googlebot 之外的 AI 機器人在該網路上平均佔 HTML 請求的 4.2%,而 Googlebot 一家佔 4.5%;截至 12 月 2 日,人類產生了 47% 的 HTML 請求,非 AI 機器人產生 44%。1 十次 HTML 請求裡,有九次以上和 AI 爬蟲毫無關係。某託管平台 2024 年底一個月的自有日誌,用另一條路徑得到了同樣的形狀:兩個最大的 AI 爬蟲加起來,約為同期 Googlebot 抓取量的 20%。3

有一條限定條件必須跟著這裡的每一個數字走。Googlebot 和 Bingbot 同時為搜尋索引和 AI 訓練而抓取,所以把它們算進搜尋那一桶還是 AI 那一桶,是一個標註決定,而不是關於封包的事實。Cloudflare 兩邊都算 Googlebot,這也是為什麼它的 AI 爬蟲總覽裡排在最前面的,是一個多數人不會稱之為 AI 爬蟲的機器人。1

成長

真正成長的是 AI 抓取的哪一部分?

Cloudflare 按聲明的用途給 AI 抓取分類:訓練,即為了建立模型而收集內容;搜尋,即建立答案接地所用的索引,也可能包含檢索增強生成;以及使用者觸發,即因為有人剛剛問了助手一個問題而發生的抓取。第四個桶裝的是用途未聲明或不明的爬蟲。1 這三個已聲明的類別在 2025 年走出了三個不同的方向,而這個分化就是全部的發現。

訓練類主導了體量,峰值時可達搜尋類抓取的 7 到 8 倍、使用者觸發類的 32 倍。1 使用者觸發類成長最快:它年初是三類裡最小的,在 1 月和 2 月裡翻了一倍多,3 月初又翻一倍,此後一路上行。Cloudflare 自己給這條曲線的小標題寫的是 2025 年成長超過 15 倍,而緊挨著的段落寫的是從 1 月到 12 月初成長超過 21 倍。1 該文並未把兩者對齊,所以值得引用的是比較保守的那個數字,而這個落差本身也值得知道。

搜尋類抓取是沒人拿去做標題的那條曲線,卻是引用真正依賴的那一條。它在 3 月中之前最強,隨後下降了約 40%,之後緩慢恢復,到統計區間結束時比年初低了將近 10%。1 單個爬蟲的分化同樣劇烈:OAI-SearchBot 在 10 月底衝高到約為 1 月的 5 倍,PerplexityBot 收尾時約為年初的 3.5 倍,ClaudeBot 上半年基本翻倍、之後回落到比年初高約 10%,而 GPTBot 在 6 月見頂,11 月收尾時只比年初略高。1 哪個令牌屬於哪一類用途,各家廠商都有文件說明,也在讀爬蟲日誌那一篇裡列成了表。456

構成

AI 爬蟲的流量裡有多少是你的 HTML?

並不全是,而且各家之間的差別大到足以改變封鎖其中任何一家能省下什麼這個答案。Vercel 與 MERJ 測量了 AI 爬蟲在 nextjs.org 上抓取的內容類型,發現 ChatGPT 的抓取有 57.70% 是 HTML,而 Claude 有 35.17% 是圖片;兩者還各有一部分花在它們並不執行的 JavaScript 檔案上,分別是 11.50% 和 23.84%。3 Googlebot 跨 Gemini 與搜尋的抓取則又是另一種分佈:31.00% HTML、29.34% JSON、20.77% 純文字、15.25% JavaScript。3

對容量來說有兩點推論。AI 爬蟲在吃你的頻寬這句抱怨,對每一家廠商都是不同的一句話,因為其中一家主要是在從你的來源伺服器拉文件,另一家主要是在拉圖片,這兩者落在你帳單的不同行上。而一個去抓自己從不執行的腳本包的爬蟲,是在買它讀不懂的位元組,所以這一部分是資源與快取問題,不是內容問題。至於它們究竟會不會執行 JavaScript,JavaScript 會執行嗎是它自己的問題。

這裡的樣本必須明說,因為內容類型構成正是那種最經不起搬運的統計量。那些百分比來自 2024 年年底一個月裡、一套框架上、一個以技術文件為主的站點,而在此後的二十個月裡沒有任何複現被發表。一個圖片很重的媒體站,或者一個商品目錄龐大的商店,都不會看到那樣的分佈。在照抄別人的分佈來做規劃之前,先從你自己的邊緣日誌裡拉一份同樣的拆分。

成本

這些流量到底花了你多少成本?

比圍繞它的爭論所假設的要少,而且一次查詢比一場會議更快給出答案。按全網平均,除 Googlebot 之外的 AI 機器人大約佔每二十四次 HTML 請求中的一次。1 一個每月承載十萬次 HTML 請求的站點,對應大約四千次抓取,這在任何現代技術堆疊上都算不上一次容量事件。一個正在權衡要不要封鎖的團隊,更值得先把一個月的邊緣日誌按 user-agent 類別、狀態碼和回應位元組分組,因為這個數字要麼大到足以支撐後面的討論,要麼不。

成本真正咬人的地方,比流量這個詞所暗示的要窄。它集中在沒有命中快取、一路打到你應用上的 HTML,集中在那個主要想要圖片的爬蟲帶來的圖片出網流量,以及集中在被你的框架動態渲染、而不是從邊緣直接回傳的錯誤頁上。這三件事都是快取與資源決策,都同時讓真人訪客受益,而且都比一場政策之爭便宜。

全網平均值對任何一個具體站點也都是很差的先驗。2025 年 10 月,零售與電腦軟體合計吸走了略超過 40% 的 AI 爬蟲活動,前十個產業合計略低於 70%。1 按地區看,Googlebot 在 Cloudflare 測量到的每一個地區都佔據爬蟲流量的 35% 到 55%,GPTBot 或 Bingbot 以 13% 到 14% 位居第二。1 一個軟體技術文件站和一個在地服務站,並不來自同一個分佈,而平均值也不是它們中的任何一個。

基線

你自己的抓取流量,什麼時候才算真的變了?

比一張圖看上去的次數要少,因為基線本身在動。在一個由數百萬站點組成的網路上,AI 佔 HTML 請求的總體份額在同一年裡,從 4 月初的 2.4% 一路擺到 6 月底的 6.4%,兩倍半以上的擺幅,而沒有任何一個站點做了什麼。1 所以你自己的抓取曲線在一季裡翻倍,完全符合大盤在你腳下移動這個解釋;要把它歸因於你上線的某件事,需要的是那次比對,而不只是那條曲線。年度回顧所依據的 Radar 即時曲線是公開的,做這次比對不花錢。2

另有兩個常見且很容易避免的讀法錯誤。把 AI 機器人匯總成一條線,會掩蓋上面那段的分化:三個具名爬蟲在同一年裡分別收在約 3.5 倍、1.1 倍和基本持平。而一條包含雙重用途 Googlebot 的匯總曲線,和一條不包含它的曲線,是兩條不同的曲線,差距大約就是它自己那麼大;所以兩張互相矛盾的圖,可能只是在統計不同的母體。1

在你自己的量級上,一次計數變動算不算真實,是另一個統計問題、有另一個答案,讀爬蟲日誌那一篇把它推演過一遍。這裡的問題排在它前面:一個變化完全可以在你的站點上是真的,同時又根本不是關於你的站點的。

決策

這些資料該改變什麼,又不該改變什麼?

有三個決策會因為這些資料變得更好,有一個會變得更糟。它應該改變你怎麼做預算:把 HTML 快取在邊緣、提供尺寸合適的圖片、讓錯誤從邊緣回傳而不是從應用回傳,這樣抓取就被吸收掉了,誰都不必去動 robots.txt 檔案。它應該讓你更清楚地讀自己的令牌策略,因為訓練類抓取花掉你的位元組、在答案側什麼都不回報,而搜尋側抓取才是引用所依賴的那一類。它還應該重置預期,因為抓取量的一次衝高是輸入,不是結果。

它不該改變的,是你對能見度的任何斷言。目前沒有任何公開研究把單站點的抓取量和單站點的引用率連起來,這兩份資料集沒有共同的識別碼,所以抓取成長並不構成下游有任何改善的證據。要不要給這些流量加閘或封鎖,是另一個建立在另一批證據上的決策,由付費牆與封鎖那一篇接手。

本文誠實的邊界

這裡幾乎每一個數字都來自兩家廠商對自己網路的報告,一家是內容傳遞網路,一家是託管平台,而兩個樣本都不是整個網路。內容類型的百分比來自 2024 年年底的單一站點,此後沒有被複現過。2025 年的各項份額截止到 2025 年 12 月 2 日,而爬蟲的構成此後已經變了。所有這些都沒有對照引用結果做過驗證,因為沒有任何公開研究把單站點的抓取行為和單站點的引用率連起來。請把它們全部讀成一個大致合理的區間,把你自己的邊緣日誌當作真正的測量。

產品派得上用場的地方,和派不上的地方

這一頁上的所有內容,都是對你已經擁有的日誌做一次查詢:把一個月的邊緣請求按 user-agent 類別、狀態碼和回應位元組分組,你就得到了自己那份 AI 抓取流量的形狀,一分錢都不用花。Bavior 做的是答案那一側的事:按排程在五個引擎上跑一組固定的 prompt 面板,記錄每個答案引用了哪些來源。Bavior 不做的,是讀你的存取日誌、統計爬蟲位元組、給你的快取定容量,或者告訴你某次抓取成長造成了某個引用;最後這一件誰也做不到,因為抓取側和答案側沒有共同的識別碼。免費 AI 能見度檢測免費 GEO 健檢不需要付費方案即可使用;付費方案為按月付費每月 $99 起,或按年付費每月 $79.17(截至 2026 年 8 月 30 日)。

出處,全部核查於 2026 年 8 月 30 日
  1. Cloudflare Radar 2025 年度回顧,資料區間 2025 年 1 月 1 日至 12 月 2 日;已核驗機器人的類別份額、各機器人份額、用途分類及其走勢、HTML 請求份額、robots.txt 指令構成、2025 年 10 月按地區與產業的抓取分佈:blog.cloudflare.com/radar-2025-year-in-review
  2. Cloudflare Radar,AI Insights(年度回顧背後的即時曲線,含機器人最佳實務與 robots.txt 中出現的 AI user-agent):radar.cloudflare.com/ai-insights
  3. Zecchini、Moore、Ubl、Siddle,《The rise of the AI crawler》,Vercel 與 MERJ,2024 年 12 月 17 日;來自 nextjs.org 與 Vercel 網路該取樣月份的第一方日誌資料;各爬蟲的內容類型佔比與相對抓取量:vercel.com/blog/the-rise-of-the-ai-crawler
  4. OpenAI,爬蟲與機器人文件(GPTBot 用於訓練、OAI-SearchBot 用於搜尋、ChatGPT-User 用於使用者觸發的抓取;第一方):developers.openai.com/api/docs/bots
  5. Anthropic,《Does Anthropic crawl data from the web?》(ClaudeBot、Claude-SearchBot、Claude-User;第一方):support.claude.com/en/articles/8896518
  6. Google 搜尋中心,《Google user-triggered fetchers》(把使用者觸發型抓取器單列為一個有文件記載的類別;第一方):developers.google.com/crawling/docs/crawlers-fetchers/google-user-triggered-fetchers
  7. Perplexity,機器人文件(PerplexityBot 與 Perplexity-User;第一方):docs.perplexity.ai/guides/bots
常見問題

你想知道的,都在這裡。

AI 爬蟲的流量已經超過 Googlebot 了嗎?

沒有,至少在唯一一個大到能公布這個對比的網路上沒有。2025 年全年,Cloudflare 給出的數字是:搜尋引擎爬蟲佔已核驗機器人流量的 40%,AI 爬蟲是它的一半,20%。只統計 HTML 請求時,除 Googlebot 之外的 AI 機器人平均佔 4.2%,而 Googlebot 一家就佔 4.5%。AI 抓取是真實的、也在成長,但它的量級大致相當於 Googlebot,而不是它的若干倍。

2025 年成長的是哪一類 AI 抓取?

成長的是訓練類和使用者觸發類抓取,搜尋類沒有成長。Cloudflare 的報告顯示,訓練類佔據 AI 爬蟲流量的絕大多數,峰值時可達搜尋類抓取的 7 到 8 倍,而使用者觸發類全年成長超過 15 倍。搜尋類抓取,也就是建立答案接地所用索引的那一類,在統計區間結束時比年初低了將近 10%。那個被拿去做標題的成長,並不在產生引用的那一類上。

AI 爬蟲只抓 HTML 頁面嗎?

不是,而且各家的構成差別很大。在一個被測量的站點上,ChatGPT 的抓取有 57.70% 是 HTML,而 Claude 有 35.17% 是圖片;兩者還分別把 11.50% 和 23.84% 花在它們並不執行的 JavaScript 檔案上。Googlebot 跨 Gemini 與搜尋的抓取則分佈得更均勻:31.00% HTML、29.34% JSON、20.77% 純文字、15.25% JavaScript。所以頻寬抱怨對不同爬蟲指的並不是同一件事。

AI 抓取流量的成本高到值得封鎖它嗎?

單看流量通常不值得,而且確認只要一次查詢。按全網平均,除 Googlebot 之外的 AI 機器人大約佔每二十四次 HTML 請求中的一次;也就是說,一個每月承載十萬次 HTML 請求的站點,大約會收到四千次 AI 抓取。做決定之前,先把自己一個月的邊緣日誌按 user-agent 類別和回應位元組分組。快取、尺寸合適的圖片,以及在邊緣直接回傳錯誤,通常就把這件事解決了。

我這一季的 AI 抓取量翻倍了,是我的站點變了嗎?

可能不是,因為基線本身就在動。在一個由數百萬站點組成的網路上,AI 佔 HTML 請求的總體份額在同一年裡從 2.4% 波動到 6.4%,兩倍半以上的擺幅,而這不是任何單一站點造成的。在把變化歸因於你上線的某件事之前,請先拿你的曲線去和一條公開的全網曲線比對,並且按爬蟲分開看,而不是讀一條匯總起來的線。

Bavior 編輯部

負責研究與維護 Bavior 關於 Reddit 行銷和 AI 搜尋可見度的所有內容。文中每一個數字都註明了來源出處與查證日期,所有外部連結均非聯盟推廣連結。

發現數字有誤?告訴我們,我們會重新查證:support@bavior.com

這些流量比圍繞它的爭論要小。
在做任何決定之前,先量一量。

免費試用