先找被浪費的抓取,其次是缺失的覆蓋,最後才是需求,因為這正是它們可被修復的先後次序。每一件都是在同一份過濾後的日誌上做一次聚合,沒有一件需要超出你現有存取日誌查詢工具的東西。
第一:每個令牌的狀態碼構成。按令牌與狀態碼類別分組,分別讀每個令牌的 2xx、3xx 與 4xx 佔比。AI 爬蟲跟隨網站結構的能力明顯不如 Googlebot。某基礎設施服務商 2024 年 12 月的日誌研究,在採樣月份內涵蓋 5.69 億次 GPTBot 與 3.70 億次 ClaudeBot 抓取,發現 GPTBot 有 34.82% 的抓取打在 404 上、14.36% 打在轉址上,ClaudeBot 有 34.16% 打在 404 上,而 Googlebot 對應的是 8.22% 與 1.49%。6 可執行的部分在那個百分比底下的 URL 清單:把你自己的 404 按抓取次數排序,你就得到一份排好序的失效內部連結與過期網站地圖條目清單。
第二:你意圖最高的那些頁面的覆蓋情況。寫下那十到二十個能回答購買問題的 URL,也就是定價、對比、整合、安全,以及處理異議的頁面,然後逐一對照日誌,看過去 30 天裡有沒有一次成功的搜尋側抓取。沒人檢索的頁面不可能被引用,所以這裡的一個零,比答案側的任何比率都更有分量。有兩種失敗形態反覆出現:只被某一家廠商的搜尋令牌抓到、其他都沒有,這通常指向 robots.txt 或渲染上的差異;以及幾個月前被抓過一次、之後再沒回訪,這通常指向指向它的內部連結太弱。
第三:使用者觸發型的到達。把 ChatGPT-User、Claude-User 和 Perplexity-User 的抓取分開統計,按天、按路徑。它們不按抓取排程運行;它們發生,是因為有人問了一個問題、助手就跑去看了一眼。請把它們讀作收到它們的那些頁面上的需求訊號,並留意有沒有新路徑冒出來:一個對比頁開始收到使用者觸發型抓取,是在告訴你有人正把你放進候選名單裡討論。Cloudflare 全網 2025 年度回顧報告,使用者行為觸發的抓取在這一年裡成長超過十五倍。7