首頁/學習 GEO/爬蟲令牌
技術 GEO · 那個決定

哪些爬蟲令牌真的要緊,而哪一個是不該封鎖的那個?

每個令牌都是一行獨立的規則,各有各的代價;而兩種錯誤的方向剛好相反:封錯了那一個,你就離開了答案;封掉你本來就想封的那一個,什麼看得見的變化都不會有。

本頁內容
分享本文
分享到 X 分享到 LinkedIn
簡短回答

決定一個引擎能不能引用你的,是它的搜尋側爬蟲,一共五個:OAI-SearchBot、Claude-SearchBot、PerplexityBot、Applebot 和 Googlebot。每一個訓練側令牌都是另一條規則、另一種效果,所以禁止 GPTBot、ClaudeBot 或 Applebot-Extended,不會從一個以搜尋接地的回答裡拿走任何東西。光是 Google 一家,就在兩個頁面上記錄了十一個常規爬蟲令牌和九個使用者觸發型抓取器,並點名其中一項是搜尋中 AI 功能的控制項:寫給 Googlebot 的指令。567

關鍵要點
  • 除非你有理由不這麼做,否則放行那五個搜尋側令牌;檔案裡其餘每一行,都當成一個獨立的、有獨立價碼的決定。
  • 有一個訓練令牌不再是零代價:Google-Extended 現在同時管訓練和接地,所以禁止它會把你從 Gemini Apps 裡移除,而 AI Overviews 和 AI Mode 完全不受影響。
  • 代價高昂的封鎖幾乎從來不是選出來的:一條通配符禁止規則、一條 Apple 文件寫明 Applebot 也會遵守的 Googlebot 規則,以及一條根本不讀 robots.txt 的防火牆規則。
  • 四個使用者觸發型抓取器裡有三個按設計就忽略 robots.txt。Anthropic 的 Claude-User 是你真能關掉的那一個,而關掉它的代價,是失去有人正在提問的那一刻的檢索。
那個例外

封鎖每個令牌,實際要付什麼代價?

Google-Extended 是值得讀兩遍的那一列。Google 的文件把它描述成一個令牌,用來管理抓取到的內容是否「可用於訓練未來世代的 Gemini 模型」,以及是否可用於「在 Gemini Apps 與 Vertex AI 上的 Grounding with Google Search 中做接地(在提問當下把 Google 搜尋索引裡的內容提供給模型,以提升事實性與相關性)」;而同一條目又寫明,Google-Extended「不影響網站在 Google 搜尋中的收錄,也不被當作 Google 搜尋的排名訊號」。5 這兩半同時成立,合起來畫出一條大多數文章漏掉的線:禁止 Google-Extended 是一個離開 Gemini 助理的決定,不是一個關於 AI Overviews 的決定。

AI Overviews 與 AI Mode 在那條線的另一側,因為它們就是搜尋。Google 直接點名了控制項:「AI 已內建於搜尋,是搜尋運作方式中不可分割的一部分,這正是為什麼寫給 Googlebot 的 robots.txt 指令,就是網站擁有者用來管理存取的控制項」;而決定一個頁面能被顯示多少的槓桿,是 nosnippetdata-nosnippetmax-snippetnoindex7 緊接著的下一句,Google 才提出 Google-Extended,用於「Google 其他一些系統裡的 AI 訓練與接地」。

其餘各列同樣值得逐字讀。OpenAI 的措辭比常見的轉述要窄:一個對 OAI-SearchBot 選擇退出的網站「不會出現在 ChatGPT 的搜尋回答裡,但仍可能以導覽連結的形式出現」。1 Apple 的 Applebot-Extended 根本不是爬蟲,因為文件說它「不抓取網頁」,存在的目的只是「決定如何使用 Applebot 這個 user agent 抓取到的資料」。4

誤傷

哪個是不該封鎖的那個,它又是怎麼被誤封的?

大多數情況可歸為三種形態,沒有一種是有人決定要封鎖 AI 爬蟲。

第一種形態是通配符。一個帶著寬泛 DisallowUser-agent: * 群組,會一次移除所有搜尋側令牌,而它幾乎總是繼承來的,不是選出來的。有個團隊把預備環境的 robots.txt 推上了生產環境,丟掉了整站所有搜尋側抓取,兩週後才從一份存取日誌裡發現,因為一個沒被抓取的頁面,根本不會產生曝光,也就沒有什麼可以少掉。

第二種形態是文件裡寫明的繼承。Apple 說:「如果 robots 指令沒有提到 Applebot 但提到了 Googlebot,Apple 的機器人會遵循 Googlebot 的指令。」4 於是,多年前為了把 Googlebot 擋在篩選頁目錄之外而寫的規則,同時也是一條 Applebot 規則,而 Applebot 正是 Spotlight、Siri 與 Safari 背後的令牌。同一頁還記載 Applebot 不理會 crawl-delay,所以用那種方式寫出來的速率限制同樣毫無作用。

第三種形態根本不在 robots.txt 裡。一個 Web 應用防火牆、機器人管理產品,或一條過於激進的速率限制,會在任何指令被讀取之前就先回應,而一個 403 不是爬蟲可以拒絕的請求。Perplexity 自己的文件就附了一步步的 Cloudflare 與 AWS 防火牆設定說明,用來放行它的機器人,3 這相當能說明真正卡住的那一層有多常在檔案之上,而不在檔案之內。作用域是安靜的第四種:robots.txt 以主機為單位,所以行銷網站上的一條規則,對文件子網域什麼也沒說。Anthropic 要求發布者在「每一個你希望退出的子網域」上重複這項變更。2

不具約束力

使用者觸發型抓取器到底守不守 robots.txt?

大多數不守,而且每家廠商都自己說了。OpenAI 寫明 ChatGPT-User 會在有人提問時造訪頁面,「因為這些動作由使用者發起,robots.txt 規則可能不適用」,而且它「不用於判定內容是否可以出現在搜尋中」。1 Perplexity 對 Perplexity-User 的寫法一樣:「由於這次抓取是使用者要求的,這個抓取器通常忽略 robots.txt 規則。」3 Google 則把這條規則套用在整個類別上,寫道「因為這次抓取是使用者要求的,這些抓取器通常忽略 robots.txt 規則」,而這個類別現在包含 Google-Agent,由 Google 基礎設施上的 Agent 使用,依使用者的要求瀏覽網頁並採取行動。6

Anthropic 是例外,而且是有用的那種。Claude-User 和 ClaudeBot、Claude-SearchBot 列在同一張表裡,是一個發布者可以設定存取權的機器人;停用它會「阻止我們的系統在回應使用者查詢時取用你的內容,這可能降低你網站在使用者主導的網頁搜尋中的能見度」。2

這個決定是從那種不對稱裡推出來的,不是從任何偏好裡推出來的。四個裡有三個沒什麼好決定的。對第四個,答案幾乎總是維持放行,因為一次使用者觸發的抓取,就是此刻有一個人在打聽你。如果某個頁面真的不能被讀到,robots.txt 從來就不是那個機制;身分驗證才是。

操作流程

怎麼用一個下午,逐個令牌把決定做完?

01

去取那個檔案,不要讀倉庫

為你擁有的每一台主機,從公開網際網路請求一次 robots.txt。一條 CDN 規則、一次轉址或一次過期的部署,都會讓實際送出的檔案與倉庫裡那份不同,而這比預期的更常發生。

02

逐個令牌按名字判斷

分組與優先序讓 robots.txt 很難靠肉眼判斷。請一個一個令牌地過,而不是掃過去找你記得自己寫過的那幾條規則。

03

檢查檔案之上的那一層

防火牆規則、機器人管理、速率限制與地區封鎖,都會在任何指令被讀取之前先回應。一個收到 403 的爬蟲,永遠走不到你那條 Allow。

04

按主機重複,不是按網站

robots.txt 的作用域是單一主機。Anthropic 要求發布者在每一個想涵蓋的子網域上重複這項變更,而這在放行的方向上同樣適用。2

05

先等一天再下判斷

OpenAI 說一次 robots.txt 更新大約需要 24 小時才會傳到它的系統;Perplexity 的文件也寫最多 24 小時。13

06

回到自己的日誌裡確認

決定是在一個文字檔裡做出的;而它確實生效的證據,是存取日誌裡一次成功的搜尋側抓取,那是另一件事,有另一套陷阱。

預設姿態一行就寫得完:除非你有理由不這麼做,否則放行全部五個搜尋側令牌;把每個訓練側令牌當成一個沒有搜尋代價的商業決定,Google-Extended 除外。這裡沒有一步會自我修正,因為一次封鎖從不會在你會看的任何儀表板上表現為一次下滑。檔案一旦對了,問題就轉向實際到達了什麼,那是日誌的問題;讀爬蟲日誌講的是該把哪些令牌分開計算、該預期怎樣的錯誤率,以及怎麼確認一個爬蟲真的是它自稱的那個。

衰減

任何令牌清單為什麼都會過期,該怎麼辦?

因為這些清單今年就動過,而且動在決定上。OpenAI 現在記錄了第四個令牌 OAI-AdsBot,它「只造訪被提交為廣告的頁面」,而它的資料「不用於訓練生成式 AI 基礎模型」。1 Google 把爬蟲文件搬出了 Search Central:/search/docs/crawling-indexing/ 底下的舊路徑現在會轉址到一個獨立的 crawling 區塊,於 2026 年 8 月 30 日核對。56 而 Google-NotebookLM 在那裡只以一個支援到 2026 年 8 月的舊 Agent 出現,由 Google-GeminiNotebook 取代,所以那扇窗本月就關上。6

Google 的抓取器頁面還提到一項以 agent.bot.goog 為身分的 Web Bot Auth 協定實驗,6 它會把爬蟲的身分從一個自行宣告的標頭字串,換成某種帶簽章的東西。如果那變成常態,文字檔裡的一個名字就不再是做決定的單位。

Google 的兩個頁面也都說這份清單「並不詳盡」,另有第三個頁面涵蓋特殊情況的爬蟲,所以請把上面那些令牌當成下限,而不是普查。接下來的事並不好看:在行事曆裡放一個週期性提醒,重讀那五份廠商頁面,再拿它們和你檔案裡假定的東西做 diff。一份只寫過一次的 robots.txt,會持續替你做決定,而它造成的失敗是無聲的。

本文的誠實邊界

這裡的每一條主張都是廠商的自我描述:這是強證據,但仍然不是測量。文件說的是一個令牌是做什麼用的,不是它背後的爬蟲實際做了什麼;而且沒有任何已發表的研究,把某個特定網站上的一次 robots.txt 變更,和該網站被引用率的一次可測變化連起來,所以從放行搜尋令牌到被引用的這一步,是假定的,不是被證明的。這些頁面老化的速度也不一樣:Anthropic 那頁標著 2026 年 4 月 7 日,Perplexity 那頁標著 2026 年 1 月 29 日,Google 的 AI 功能頁標著 2025 年 12 月 10 日、生成式 AI 指南標著 2026 年 7 月 10 日,而 OpenAI 那頁沒有日期。另外,robots.txt 是請求而不是存取控制,所以以上沒有一條描述了一個不表明身分的抓取器。

產品在哪裡派得上用場,在哪裡派不上

這裡的每一個決定都是免費的,一個下午就能做完:為每一台主機取一次實際送出的 robots.txt,逐個令牌按名字判斷,檢查它之上的防火牆層,按子網域重複一遍,然後等一天。沒有工具能替你做這個判斷:你的內容該不該去訓練別人的模型,是商業問題,不是技術問題。Bavior 做的是閘門之後那一層:它按排程在五個引擎上跑一組固定的 prompt 面板,並記錄每一條回答引用了哪些來源,這樣你就能看出一次令牌變更有沒有改變出現的是誰。它不會編輯你的 robots.txt,不會讀你的伺服器日誌,不能解開你的防火牆正在拒絕的頁面,也不能告訴你新得到的某次引用來自你改的那個令牌。免費 AI 能見度檢測免費 GEO 健檢不需要付費方案;付費方案為按月付費每月 $99 起,或按年付費每月 $79.17(截至 2026 年 8 月 30 日)。

出處,全部核查於 2026 年 8 月 30 日
  1. OpenAI,《Overview of OpenAI Crawlers》(OAI-SearchBot、OAI-AdsBot、GPTBot、ChatGPT-User;放行其一、禁止另一;無日期):developers.openai.com/api/docs/bots
  2. Anthropic,《Does Anthropic crawl data from the web?》,標註 2026 年 4 月 7 日(ClaudeBot、Claude-SearchBot、Claude-User;停用各自的後果;逐子網域):support.claude.com/en/articles/8896518
  3. Perplexity,《Perplexity Crawlers》,標註 2026 年 1 月 29 日(PerplexityBot;Perplexity-User「通常忽略 robots.txt 規則」;防火牆步驟):docs.perplexity.ai/docs/resources/perplexity-crawlers
  4. Apple,《About Applebot》(Applebot 與 Applebot-Extended;遵循 Googlebot 指令的回退;不支援 crawl-delay):support.apple.com/en-us/119829
  5. Google,《List of Google’s common crawlers》(十一個令牌;Google-Extended 關於訓練、接地與不影響搜尋的措辭):developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers
  6. Google,《List of Google user-triggered fetchers》(九個抓取器;Google-Agent;Google-NotebookLM 由 Google-GeminiNotebook 取代;Web Bot Auth):developers.google.com/crawling/docs/crawlers-fetchers/google-user-triggered-fetchers
  7. Google Search Central,《AI features and your website》,更新於 2025 年 12 月 10 日(Googlebot 是搜尋中 AI 功能的控制項;摘要控制項):developers.google.com/search/docs/appearance/ai-features
  8. Google Search Central,《Google’s Guide to Optimizing for Generative AI Features on Google Search》,更新於 2026 年 7 月 10 日(生成式功能「根植於我們核心的搜尋排名與品質系統」):developers.google.com/search/docs/fundamentals/ai-optimization-guide
常見問題

你想知道的,都在這裡。

封鎖 Google-Extended 現在還是零代價嗎?

不完全是,而且這一點變了。Google 的爬蟲文件現在把 Google-Extended 描述成同時管接地和訓練,也就是在提問當下於 Gemini Apps 與 Vertex AI 上送給模型的搜尋索引內容。同一條目仍然寫明它不影響在 Google 搜尋中的收錄,也不在那裡當作排名訊號。禁止它的代價是失去 Gemini 助理,而 AI Overviews 與 AI Mode 不受影響。

我能阻止 AI 助理在使用者提問時抓取我的頁面嗎?

用 robots.txt 通常不行。OpenAI 寫道 ChatGPT-User 的規則可能不適用,因為那個動作由使用者發起;Perplexity 寫道 Perplexity-User 通常忽略 robots.txt;Google 對它整個使用者觸發型抓取器類別(包含 Google-Agent)也是同樣的說法。Anthropic 是例外:Claude-User 是一個你可以設定存取權的機器人,停用它會停止在回應使用者查詢時的檢索。想要比這更強的效果,需要的是身分驗證,而不是一條指令。

如果我只檢查 robots.txt 裡的一行,該檢查哪一行?

通配符那一組。User-agent 星號底下一條寬泛的禁止規則會一次移除所有搜尋側爬蟲,而它通常是從預備環境的檔案或某個平台預設值繼承來的,不是選出來的。先查它,再去查任何具名令牌,然後確認那五個搜尋側令牌在你擁有的每一台主機上都被放行,而不只是在主要行銷網域上。robots.txt 以主機為作用域,所以子網域需要自己的檔案。

robots.txt 能讓我的內容不出現在 AI 答案裡嗎?

它能擋住那些遵守規則的爬蟲,而這並不是同一件事。一條指令是請求,不是存取控制;使用者觸發型抓取器按設計大多會忽略它;而且你檔案裡的任何內容都管不了別人的頁面怎麼寫你。一個引擎完全可以根據它從別處取來的一篇評測、一則論壇討論串或一份同類產品對比,準確地描述你的產品。

Bavior 編輯部

負責研究與維護 Bavior 關於 Reddit 行銷和 AI 搜尋可見度的所有內容。文中每一個數字都註明了來源出處與查證日期,所有外部連結均非聯盟推廣連結。

發現數字有誤?告訴我們,我們會重新查證:support@bavior.com

一個文字檔裡的一行,
決定了誰有資格引用你。

免費試用