首頁/學習 GEO/讀爬蟲日誌
測量 AI 能見度 · 爬蟲那一側

GEO 裡該怎麼讀 AI 爬蟲日誌?

答案側的取樣告訴你結果,伺服器日誌告訴你輸入到底有沒有送達。整套分析就是一個過濾、三個問題、一個核驗步驟,而且要按這個順序,因為順序正是讓你不去讀噪聲的那個東西。

本頁內容
分享本文
分享到 X 分享到 LinkedIn
簡短回答

按 user-agent 令牌過濾你的存取日誌,把搜尋側、訓練側和使用者觸發型這三類分開,永遠不要把它們彙總成一條線。然後按這個順序讀三件事:每個令牌的錯誤率、你意圖最高的那些頁面到底有沒有被抓取過,以及使用者觸發型抓取器落在哪裡。先從錯誤看起,因為它通常是最大的單一損失:在某基礎設施服務商 2024 年 12 月的日誌研究裡,GPTBot 有 34.82% 的抓取打在 404 上,而 Googlebot 是 8.22%。6

關鍵要點
  • 要分三類而不是兩類:搜尋側令牌(OAI-SearchBot、Claude-SearchBot、PerplexityBot、Applebot、Googlebot)、訓練側令牌(GPTBot、ClaudeBot、Google-Extended、Applebot-Extended),以及使用者觸發型抓取器(ChatGPT-User、Claude-User、Perplexity-User、Google-Agent)。每一組拆分都由廠商自己寫在文件裡。
  • 先修被浪費的抓取:把你自己的 404 按抓取次數排序,就得到一份排好序的失效內部連結與過期網站地圖條目清單。
  • 一個零勝過一個百分比。一個高意圖頁面在 30 天內沒有任何一次成功的搜尋側抓取,是真實的發現;而計數從 12 掉到 7 只是噪聲。
  • user-agent 標頭是自我聲明的,所以在你相信它的任何一部分之前,先拿廠商公布的位址段核驗它。
過濾

哪些 user-agent 令牌該分開統計?

要分三類而不是兩類:建立答案接地所用索引的搜尋側爬蟲、不改變任何答案的訓練側爬蟲,以及在有人提問時才到達的使用者觸發型抓取器。

每家主要廠商都自己把這個拆分寫進了文件,所以下面這張表是第一方資訊而不是推測。第三欄正是多數日誌報告會略去的那一欄。

廠商搜尋側令牌訓練側令牌使用者觸發型抓取器
OpenAIOAI-SearchBotGPTBotChatGPT-User1
AnthropicClaude-SearchBotClaudeBotClaude-User2
PerplexityPerplexityBot文件中無記載Perplexity-User3
AppleApplebotApplebot-Extended文件中無記載4
GoogleGooglebotGoogle-Extended5Google-Agent10

把這三類彙總成一條「AI 機器人」曲線,是讓一份日誌報告變得毫無用處的那個錯誤,因為這三類回答的是不同的問題。搜尋側抓取下降,是一個你這週就該修的檢索問題。訓練側抓取下降,對任何答案都不代表什麼。而使用者觸發型抓取上升,根本不是維護訊號:那是有人此刻正在問起你,是這個領域能給出的、最接近需求資料的東西。

請拿廠商文件去核對這張表,而不是拿某篇部落格文章(包括本文)去核對,因為這份清單是會變的。OpenAI 現在文件裡多了第四個令牌 OAI-AdsBot,用來校驗被提交為廣告的頁面;1 Google 把使用者觸發型抓取器單獨列為一個類別,其中包含 Google-Agent,並把原先的 Google-NotebookLM 標註為只支援到 2026 年 8 月,由 Google-GeminiNotebook 接替。10 該放行哪個令牌、封鎖每一個各自會造成什麼,是技術 GEO 這個階段的主題;本頁假設它們都已放行,只問這些流量在告訴你什麼。

三個問題

按順序該看哪三件事?

先找被浪費的抓取,其次是缺失的覆蓋,最後才是需求,因為這正是它們可被修復的先後次序。每一件都是在同一份過濾後的日誌上做一次聚合,沒有一件需要超出你現有存取日誌查詢工具的東西。

第一:每個令牌的狀態碼構成。按令牌與狀態碼類別分組,分別讀每個令牌的 2xx、3xx 與 4xx 佔比。AI 爬蟲跟隨網站結構的能力明顯不如 Googlebot。某基礎設施服務商 2024 年 12 月的日誌研究,在採樣月份內涵蓋 5.69 億次 GPTBot 與 3.70 億次 ClaudeBot 抓取,發現 GPTBot 有 34.82% 的抓取打在 404 上、14.36% 打在轉址上,ClaudeBot 有 34.16% 打在 404 上,而 Googlebot 對應的是 8.22% 與 1.49%。6 可執行的部分在那個百分比底下的 URL 清單:把你自己的 404 按抓取次數排序,你就得到一份排好序的失效內部連結與過期網站地圖條目清單。

第二:你意圖最高的那些頁面的覆蓋情況。寫下那十到二十個能回答購買問題的 URL,也就是定價、對比、整合、安全,以及處理異議的頁面,然後逐一對照日誌,看過去 30 天裡有沒有一次成功的搜尋側抓取。沒人檢索的頁面不可能被引用,所以這裡的一個零,比答案側的任何比率都更有分量。有兩種失敗形態反覆出現:只被某一家廠商的搜尋令牌抓到、其他都沒有,這通常指向 robots.txt 或渲染上的差異;以及幾個月前被抓過一次、之後再沒回訪,這通常指向指向它的內部連結太弱。

第三:使用者觸發型的到達。把 ChatGPT-User、Claude-User 和 Perplexity-User 的抓取分開統計,按天、按路徑。它們不按抓取排程運行;它們發生,是因為有人問了一個問題、助手就跑去看了一眼。請把它們讀作收到它們的那些頁面上的需求訊號,並留意有沒有新路徑冒出來:一個對比頁開始收到使用者觸發型抓取,是在告訴你有人正把你放進候選名單裡討論。Cloudflare 全網 2025 年度回顧報告,使用者行為觸發的抓取在這一年裡成長超過十五倍。7

量級參照

該預期多大的量,變化什麼時候才算真的?

你該預期 AI 爬蟲在你站點上的體量與 Googlebot 相當,而不是它的若干倍;也該預期你自己的多數計數小到畫不出趨勢。Cloudflare 2025 年度回顧涵蓋其網路上 2025 年 1 月 1 日至 12 月 2 日的資料,把 AI 機器人定在全年 HTML 請求的 4.2%,Googlebot 為 4.5%。7 同一份 2024 年 12 月的日誌研究給出的月度量是:Googlebot 45 億次,GPTBot 5.69 億次,ClaudeBot 3.70 億次,Applebot 3.14 億次,PerplexityBot 2,440 萬次。6 把這些比例套到你自己的 Googlebot 流量上,你就有了一個粗略的預期。

統計上的那一點比基準值更要緊,而它正是日誌報告最常搞錯的地方。單一站點上的抓取計數是小數字,而小計數的噪聲會被百分比掩蓋。如果某個搜尋側令牌上週抓了 12 個頁面、這週抓了 7 個,那不是下降 42%;對這麼小的計數來說,光是普通的卜瓦松波動就大致涵蓋了這個範圍,從中讀出趨勢就是一個錯誤。由此得出的規則是:比較計數之前先聚合到至少一個月,並把一個週期內低於約 30 次的抓取計數當成有或沒有的觀察,而不是一個數量。統計檢定力那一篇在答案側推演的是同一個問題。

引薦

抓取對引薦比告訴了你什麼?

它告訴你的是:一個平台從你站點拿走了多少,又送回來了多少,而這兩半本來就在同一份存取日誌裡。Cloudflare 的算法是把來自某平台爬蟲 user-agent 的 HTML 請求數,除以 Referer 標頭指向該平台的 HTML 請求數。11 你可以自己算同一個量:一邊是爬蟲抓取次數,另一邊是帶著 chatgpt.com、perplexity.ai、claude.ai 或 gemini.google.com 引薦來源到達的造訪。

全網口徑下這些比值是嚴重失衡的,而且平台之間相差好幾個數量級。在 2025 年,Cloudflare 給出的是:Anthropic 在 5 月之後落在 25,000:1 到 100,000:1 的區間,更早還出現過高達 500,000:1 的峰值;OpenAI 起伏很大,3 月前後峰值約 3,700:1;Perplexity 一般低於 400:1;Google 則略高於 3:1,4 月一度到過 30:1,隨後回落。7 在讀你自己的數字之前有兩點提醒。引薦那一側會被低估,因為瀏覽器並不總是送出 Referer 標頭、某些用戶端還會把它拿掉,所以你量到的比值是一個上限。以及,比值高本身不構成判決:它描述的是一個兌換率,而不是被抓取到底值不值;對一個以被引用為目標的站點來說,點擊從來就不是它索要的那筆報酬。

核驗

你怎麼知道那個機器人真的是它自稱的那個?

在你查過它從哪個位址來之前,你並不知道,因為 user-agent 字串是一個任何東西都能送出的自我聲明標頭。核驗是把一行日誌變成證據的那一步:把來源位址與廠商公布的爬蟲位址段做比對,或者做一次反向 DNS 查詢、再對結果做一次正向查詢。OpenAI 為每個令牌各發布一份位址檔案,Anthropic 用一份檔案涵蓋它的三個爬蟲,Apple 和 Perplexity 也各自公布了自己的,1234 所以把這件事一次做成過濾規則,比事後當成一次調查來做便宜得多。

值得費這個事,是因為未聲明的抓取是一場進行中的爭議,而不是一個假想。Cloudflare 於 2025 年 8 月 4 日發布分析稱,它註冊了全新、從未被收錄過的網域,並用 robots.txt 禁止一切抓取,而某個助手仍然回傳了關於這些網域的詳細內容;它把這些流量歸因於一個來自該廠商公布位址段之外的位址的通用瀏覽器 user-agent,並取消了該廠商的已驗證機器人資格。8 該廠商隔天發布反駁,否認存在隱蔽抓取,並把這些請求歸因於一家第三方雲端瀏覽器服務。這場分歧至今沒有公開解決。請把它當作去做核驗的理由,而不是關於某一家公司的定論。

邊界

伺服器日誌告訴不了你什麼?

日誌無法告訴你一次抓取有沒有變成一次引用,而正是這個缺口讓答案側的面板依然必要。一個頁面可以每週都被搜尋側爬蟲抓取,卻沒有被任何地方引用;一個頁面也可以從幾個月前建好的索引裡被引用,而近期完全沒有被抓過。請把這兩份資料按時間對齊、並排著讀,並忍住那句因果句,因為「爬蟲回來了,然後我們開始出現了」是一個先後順序,不是一個機制。

還有三個盲點值得點名。代理型瀏覽器在你的日誌裡與一次普通的瀏覽器造訪無法區分:Tow 數位新聞中心 2025 年 10 月 30 日發布的分析發現,它們取到了同一批廠商的標準介面取不到的訂閱專屬素材,正是因為請求裡沒有任何東西把它們標記為自動化的。9 CDN 或邊緣快取會把抓取完全擋在來源伺服器日誌之外,所以如果可以就在邊緣讀,並預期只看來源端的數字會低估。以及,一個令牌不再出現是有歧義的:它可能被封鎖了、被改名了,也可能只是沒有新東西可抓。

日誌確實給你的,是這個領域裡唯一的第一方證據。答案側的一切都是從別人的系統裡取樣來的,這讓存取日誌成為開始一次調查的正確地方,儘管它是結束一次調查的錯誤地方。

本文誠實的邊界

這裡的量化錨點,都比它們看上去更舊、更窄。34.82% 和 34.16% 的錯誤率來自某基礎設施服務商 2024 年 12 月對自己網路的一份日誌研究,此後二十個月沒有任何複現發表;這些爬蟲在這段時間裡肯定變過,而真正主宰你站點的數字是你自己的錯誤率。Cloudflare Radar 的佔比與抓取對引薦比都是全網口徑,而一個以文件為主的站點和一個新聞站點看到的構成相當不同。請把這兩者讀作什麼算合理的量級參照,把你自己的日誌當作測量。這裡的一切都沒有對照引用結果做過驗證,因為沒有任何已發表的研究把單一站點的抓取行為與單一站點的引用率連起來。

產品派得上用場的地方,和派不上的地方

這一切都是免費的,而且本來就是你的:按 user-agent 令牌過濾存取日誌、按狀態碼類別分組、檢查你意圖最高的那二十個 URL 有沒有成功的搜尋側抓取、按天統計使用者觸發型抓取器,再拿廠商公布的位址段核驗那些位址。Bavior 做的是同一個問題的另一側:它按排程把一組固定的 prompt 面板打到五個引擎上,並記錄每條答案引用了哪些來源,這會告訴你抓取側的修復有沒有改變出現的是誰。它不做的是:讀你的伺服器日誌、核驗爬蟲位址、修你的 404,或告訴你某一次抓取變成了某一條引用;而最後這件事沒有人做得到,因為這兩份資料沒有共同的識別碼。免費 AI 能見度檢測免費 GEO 健檢不需要付費方案;付費方案為按月付費每月 $99 起,或按年付費每月 $79.17(截至 2026 年 8 月 29 日)。

出處,全部核查於 2026 年 8 月 30 日
  1. OpenAI,爬蟲與機器人文件(GPTBot、OAI-SearchBot、OAI-AdsBot、ChatGPT-User,每個令牌各有一份位址檔案;第一方):developers.openai.com/api/docs/bots
  2. Anthropic,《Does Anthropic crawl data from the web?》(ClaudeBot、Claude-SearchBot、Claude-User,含公布的位址段;第一方):support.claude.com/en/articles/8896518
  3. Perplexity,機器人文件(PerplexityBot、Perplexity-User,含公布的位址段;文件寫明 Perplexity-User「通常忽略 robots.txt 規則」;第一方):docs.perplexity.ai/guides/bots
  4. Apple,《About Applebot》(Applebot、Applebot-Extended、公布的 CIDR 檔案、瀏覽器渲染;第一方):support.apple.com/en-us/119829
  5. Google Search Central,《AI features and your website》(Googlebot、Google-Extended、收錄與摘要展示資格;第一方):developers.google.com/search/docs/appearance/ai-features
  6. Zecchini、Moore、Ubl、Siddle,《The rise of the AI crawler》,Vercel,2024 年 12 月 17 日;第一方日誌資料,採樣月份內 5.69 億次 GPTBot 與 3.70 億次 ClaudeBot 抓取;按令牌的 404 與轉址佔比:vercel.com/blog/the-rise-of-the-ai-crawler
  7. Cloudflare Radar 2025 年度回顧,資料區間 2025 年 1 月 1 日至 12 月 2 日;AI 機器人佔 HTML 請求 4.2%,Googlebot 佔 4.5%,使用者行為觸發的抓取成長超過 15 倍,並按平台給出抓取對引薦比:blog.cloudflare.com/radar-2025-year-in-review
  8. Cloudflare,《Perplexity is using stealth, undeclared crawlers to evade website no-crawl directives》,2025 年 8 月 4 日(基礎設施第一方;該廠商已於 2025 年 8 月 5 日發布反駁,否認存在隱蔽抓取):blog.cloudflare.com
  9. Tow 數位新聞中心,《How AI browsers sneak past blockers and paywalls》,2025 年 10 月 30 日;代理型瀏覽器在日誌裡與一次普通的瀏覽器造訪無法區分:cjr.org
  10. Google Search Central,《Google user-triggered fetchers》(Google-Agent、Google-GeminiNotebook,Google-NotebookLM 支援到 2026 年 8 月;這些抓取器通常忽略 robots.txt;第一方):developers.google.com/crawling/docs/crawlers-fetchers/google-user-triggered-fetchers
  11. Cloudflare,《The crawl before the fall… of referrals》,2025 年 7 月 1 日;把抓取對引薦比定義為:來自某平台爬蟲 user-agent 的 HTML 請求數,除以 Referer 標頭指向該平台的 HTML 請求數:blog.cloudflare.com/ai-search-crawl-refer-ratio-on-radar
常見問題

你想知道的,都在這裡。

我該在伺服器日誌裡找哪些 AI 爬蟲令牌?

請分成三類而不是兩類。搜尋側令牌建立的是答案接地所用的索引:OAI-SearchBot、Claude-SearchBot、PerplexityBot、Applebot 和 Googlebot,這些才是對引用要緊的。訓練側令牌,也就是 GPTBot、ClaudeBot 和 Applebot-Extended,對任何答案都沒有影響。Google-Extended 已經不再是純粹的訓練令牌:Google 的文件說它控制的是 Gemini Apps 與 Vertex AI 上的接地,所以禁止它會讓你從那個介面上消失,但不會讓你從 Google 搜尋或 AI Overviews 上消失。使用者觸發型抓取器,也就是 ChatGPT-User、Claude-User、Perplexity-User 和 Google-Agent,是因為有人剛剛問了一個問題才來的,所以它們是需求訊號而不是維護訊號。以上每一組拆分都由廠商自己寫在文件裡,所以這是一套第一方分類,而不是推測出來的。

我的 AI 爬蟲抓取次數上週從 12 掉到 7,需要擔心嗎?

不用,因為這麼小的計數帶的波動比你在看的那個變化還大。每週十來次抓取時,光是普通的隨機變異就涵蓋了這個範圍,所以從中讀出下降 42%,和在少數幾次 prompt 執行上畫一根週對週的箭頭是同一類錯誤。比較計數之前先聚合到月,並把一個週期內低於約 30 次的抓取計數當成有或沒有的觀察,而不是一個數量。在小體量下真正值得行動的是一個零:一個高意圖頁面在 30 天內沒有任何一次成功的搜尋側抓取,在任何規模的站點上都是真實的發現。

日誌裡的 user-agent 字串可信嗎?

單靠它不行,因為 user-agent 是一個任何東西都能送出的自我聲明標頭。請拿來源位址去核驗:對照廠商公布的爬蟲位址段,或者做一次反向 DNS 查詢、再對結果做一次正向查詢。OpenAI、Anthropic、Perplexity 和 Apple 都在各自的機器人文件裡公布了位址檔案,而把這項檢查一次做進過濾規則,遠比事後當成一次調查來跑便宜。這不是假想。Cloudflare 在 2025 年 8 月發布過一份分析,指稱有來自某廠商公布位址段之外的未聲明抓取,該廠商隔天予以否認,而這場分歧至今沒有公開解決。

伺服器日誌能告訴我一次抓取有沒有帶來引用嗎?

不能,其他東西也不能,因為這兩份資料沒有共同的識別碼。一個頁面可以每週都被搜尋側爬蟲抓取卻不被任何地方引用;一個頁面也可以從幾個月前建好的索引裡被引用,而近期完全沒有被抓過。請把日誌側和答案側按時間對齊、並排著讀,並在因果句之前停住,因為「爬蟲回來了,然後我們開始出現了」描述的是先後順序,不是機制。日誌是你手上關於什麼東西到達了你的伺服器的最強第一方證據,這讓它成為開始一次調查的正確地方,以及結束一次調查的錯誤地方。

AI 平台的抓取對引薦比多少算正常?

沒有正常值,平台之間的差距本身就是結論。在 2025 年,Cloudflare 給出的全網比值是:Anthropic 在 5 月之後落在 25,000:1 到 100,000:1 的區間,OpenAI 在 3 月前後峰值約 3,700:1,Perplexity 一般低於 400:1,Google 則略高於 3:1。你可以自己算:把每個平台的爬蟲抓取次數,除以帶著該平台引薦來源到達的造訪數,然後把它讀成一個兌換率,而不是一個判決。你的引薦那一側會被低估,因為瀏覽器並不總是送出 Referer 標頭,所以請把算出來的數字當作上限。

Bavior 編輯部

負責研究與維護 Bavior 關於 Reddit 行銷和 AI 搜尋可見度的所有內容。文中每一個數字都註明了來源出處與查證日期,所有外部連結均非聯盟推廣連結。

發現數字有誤?告訴我們,我們會重新查證:support@bavior.com

日誌是你唯一的第一方證據。
請按正確的順序讀它。

免費試用