首頁/學習 GEO/付費牆與封鎖
技術 GEO · 存取控制

付費牆與爬蟲封鎖能把你擋在 AI 答案之外嗎?

憑直覺給出的答案,在兩個方向上都是錯的。封鎖爬蟲不能可靠地把你擋在答案之外,而完全敞開也不能可靠地把你送進答案裡。

本頁內容
分享本文
分享到 X 分享到 LinkedIn
簡短回答

robots.txt 裡的一條 disallow 是一個請求:有文件記載的爬蟲會遵守它,而由使用者觸發的抓取常常不會。所以它管的是誰獲准抓取你,而不是你能不能被寫進答案。這讓存取控制成了一個關於你拿什麼做交換的生意決定,而不是一個能在任一方向保證結果的開關。在 Tow 中心那項覆蓋八個生成式搜尋工具、一千六百條查詢的測試裡,某個付費版助手把它本不該取得的九十段摘錄中的近三分之一正確辨識了出來。1

關鍵要點
  • 兩家廠商在文件裡寫明,其由使用者觸發的抓取器可能忽略 robots.txt;第三家寫明自己所有機器人都遵守。同一條指令,三種含義。
  • 封鎖不能阻止你被摘述。轉載副本、第三方報導,以及一個驅動普通 Chrome 工作階段的 agent,都會繞開它。
  • 封鎖也不是毫無作用:廠商在文件裡寫明,退出會把你從它們的搜尋回答裡移除,而被封鎖之後的答案被觀察到是變得含糊,而不是消失。
  • 有些封鎖和你本想留下的東西綁在一起:一個搜尋索引、你自己的摘要片段,或者廠商讀取那份承載你意願的檔案的能力。
  • 關於一次封鎖在引用上的代價,沒有任何一份已發表的測量達到本課程的出處標準,所以這筆交易的量級是未知的。
定義

robots.txt 的 disallow 到底做了什麼?

它請求某個抓取器不要請求某個路徑。有文件記載、守規矩的爬蟲會遵守這個請求,而它從來都不是存取控制:檔案是公開的,執行完全發生在對方那一側。那家提供了部署最廣的託管版 robots.txt 的基礎設施服務商,對自己更新的信號方案也是這麼說的:內容信號「表達的是偏好;它們不是針對抓取的技術性反制手段。有些公司可能乾脆忽略它們。」4

決定多數結果的那道分界,不是訓練與搜尋之分,那部分由檢索階段涵蓋。真正的分界是按排程的爬取,對上因為有人提出要求才發生的抓取,而在這條邊界上,各家廠商在自己的文件裡互相矛盾。下面每一處引文,都在 2026 年 8 月 30 日對照廠商線上頁面核對過。

由人觸發的抓取令牌廠商文件裡關於 robots.txt 的說法
OpenAIChatGPT-User「因為這些動作由使用者發起,robots.txt 規則可能不適用」5
PerplexityPerplexity-User「由於是使用者請求的抓取,這個抓取器通常會忽略 robots.txt 規則」7
AnthropicClaude-User其機器人「透過遵守 robots.txt 中的業界標準指令,尊重『請勿抓取』信號」6
Google沒有獨立令牌針對 Googlebot 的指令,就是搜尋(含 AI 功能)明訂的控制手段8
代理型瀏覽器沒有它不是爬蟲:該 agent「與一個使用標準 Chrome 瀏覽器的人無法區分」2

最後一行請讀兩遍。代理型瀏覽器是一個由人在駕駛的瀏覽器,不是一個帶著禮貌 user agent 的爬蟲:沒有任何指令是針對它的,而封鎖它的流量特徵,就等於封鎖 Chrome。

證據

被封鎖的出版商為什麼照樣被引用?

因為那條答案並不需要你的頁面。2025 年 3 月,Tow 中心跑了一千六百條查詢,覆蓋八個生成式搜尋工具,做法是貼入一段摘錄,請每個工具說出對應文章的標題、出版方、日期和 URL。在「平台從有意封鎖了它們爬蟲的出版商那裡取到了資訊」這個標題底下,某個助手的免費版把來自 National Geographic 付費文章的十段摘錄全部正確辨識,而這家出版商既已 disallow 了它的爬蟲,也與該公司沒有任何關係。1

有三條路徑會繞開封鎖,其中只有第三條有爭議。第一條是轉載:USA Today 封鎖了某個助手的爬蟲,而該助手引用了 Yahoo News 轉載的同一篇文章。第二條是第三方報導,也就是某個 agent 在不願直接觸碰某家出版商時的退路:「一份拼合式摘要,取材自關於該文章的推文、各種轉載版本、其他媒體中的引述,以及網路上的相關報導。」2 第三條是不遵守。2025 年 8 月 4 日,Cloudflare 報告稱,它註冊了全新的、從未被收錄的網域,其 robots.txt disallow 了一切,而某個助手仍然從一個位址在該廠商公布範圍之外的通用 Chrome user agent,回傳了關於這些網域的詳細內容;它把該廠商從已驗證機器人名單中除名,該廠商次日否認了隱蔽抓取,這場爭議至今未解決。3

它的概括是最值得記住的一句:「想要在搜尋結果裡獲得能見度的出版商沒有得到它,而希望退出的那些,其內容仍然違背其意願地留在結果中。」1 一份檔案對這兩種失敗都控制不乾淨。

付費牆

付費牆是把你擋在外面,還是把你送進去?

這取決於你造的是哪一種,而很多出版商造的正是那種攔不住機器的。客戶端遮罩會把整篇文章送到瀏覽器,再用一層訂閱提示把它蓋住。Tow 中心點名 MIT Technology Review、National Geographic 和 Philadelphia Inquirer 用的是這一種,並觀察到「雖然這些內容對人不可見,但像 Atlas 和 Comet 這樣的 AI agent 仍然讀得到它」。而它歸到 Wall Street Journal 和 Bloomberg 名下的伺服器端付費牆,在登入憑證通過驗證之前不會送出任何文字。2 這兩種都攔不住一位已訂閱的讀者把 agent 指向那個頁面。

它 2025 年 10 月的那次演示,是兩個方向的失敗正面相遇時最乾淨的一份公開案例。當被要求給出 MIT Technology Review 一篇九千字訂閱專屬文章的全文時,兩款代理型瀏覽器把它交了出來;而同樣兩家公司的標準對話介面上的同一條 prompt 被拒絕了,因為該刊已經封鎖了它們的爬蟲。封鎖對爬蟲有效,對瀏覽器則毫不相干。

收錄的那一半有一個不欺騙任何人的成文答案。Google 關於訂閱與付費牆內容的結構化資料指引之所以存在,用它自己的話說,是因為這些標記「幫助 Google 把付費牆內容與違反垃圾內容政策的偽裝(cloaking)做法區分開」,而它開篇就先把適用範圍收窄:「本指引只適用於你希望被抓取和收錄的內容。」9 用 isAccessibleForFree 和 hasPart 標出被門禁的那一段,就是頁面在你繼續收費的同時保住資格的方式。在沒有這些標記的情況下,把你對讀者藏起來的文字餵給爬蟲,正是這條政策所稱的 cloaking,本課程不會把這種手法交到你手上。

這筆交易

一次封鎖到底買到了什麼?

買到了一些真實的東西,也少於這場爭論兩邊各自的說法。在遵守規則的那條路徑上,它做到了它說的事。OpenAI 的文件寫道:「已退出 OAI-SearchBot 的站點不會出現在 ChatGPT 的搜尋回答中,但仍可能作為導覽連結出現。」5 Anthropic 的文件寫道,停用 Claude-SearchBot「會阻止我們的系統為搜尋優化而索引你的內容,這可能降低你的站點在使用者搜尋結果中的能見度與準確度」。6 第二句請仔細讀:廠商是在說,你一旦離開,它關於你的準確度可能會下降。

在不遵守規則的那條路徑上,關於一次奏效的封鎖改變了什麼,公開的觀察只有一份。Cloudflare 報告稱,那個隱蔽爬蟲被封鎖之後,該助手轉而依賴包括其他網站在內的其他資料來源,而「這些答案更不具體,缺少來自原始內容的細節」。3 這就是這筆交易誠實的形狀:封鎖往往降低別人談論你的品質,而不是讓別人不再談論你。

反過來,用存取權去換一紙合約,同樣買不到準確。Tow 中心把「與新聞機構簽訂內容授權協議,並不能保證聊天機器人回答中的引用是準確的」列為其發現之一;它舉的例子是一家既放行 OpenAI 搜尋爬蟲、又處在與該公司合作關係之內的出版商,而那個助手在它的十段摘錄裡只正確辨識了一段。1 存取權是準確歸因的前提,不是它的成因。

副作用

哪些封鎖的代價超出了你的本意?

有三種綁定會把一個狹窄的意圖變成一次寬泛的損失。在 Google 這邊不存在只針對 AI 的指令:「AI 已內建於搜尋,並且是搜尋運作方式中不可分割的一部分,正因如此,針對 Googlebot 的 robots.txt 指令,才是站點所有者管理其站點如何為搜尋而被抓取的控制手段。」它點名的那些更細的控制,nosnippet、data-nosnippet、max-snippet 和 noindex,同樣會砍掉你的一般結果;而 Google-Extended 管的是 Google 其他系統裡的訓練與接地,不是搜尋。8 在 Tow 中心樣本裡那些有公開爬蟲的工具中,有一個沒有被那二十家出版商中的任何一家封鎖,研究者把這歸因於它與一個通用搜尋引擎共用爬蟲:封鎖它就意味著退出那個索引。1

第三種會把你想要的效果反過來。Anthropic 的文件寫道:「像封鎖 Anthropic 機器人所使用的 IP 位址這類替代做法,可能無法正確生效,也無法持久保證退出,因為這麼做會妨礙我們讀取你的 robots.txt 檔案。」6 一條衝著爬蟲去的防火牆規則,可能讓你既被抓取又不被聽見,因為承載你意願的那份檔案,正是你封鎖掉的東西。

時間差會悄悄毀掉多數前後對比的讀數。OpenAI 表示,「從站點更新 robots.txt 起,我們的系統大約需要 24 小時來調整」;Perplexity 說變更最多可能需要 24 小時;Google 說預覽控制「可能需要幾天到幾個月不等」。578 封鎖不是一個開關,解除封鎖也不是。

決策

你該怎麼決定,又該把什麼寫下來?

在動那份檔案之前,先說清楚你要買的是哪個結果。團隊通常心裡想的那四種結果中,兩種拿得到,一種只拿得到一半,還有一種根本不在菜單上。

更低的抓取負載拿得到,而且能在你自己的日誌裡量出來。一個談判籌碼拿得到,而且那是商業判斷,不是技術判斷。更少的無歸因摘述只拿得到一半,因為上面的證據說的是摘述會退化,不是會停止。至於控制一條答案怎麼說你,它不在菜單上,而上面全部內容就是原因。如果一個頁面真的不能被讀到,請給它身分驗證,而不是一條指令。

如果你想要比允許或拒絕更細的東西,現在已經有一套詞彙:Content Signals Policy 在 robots.txt 裡加入 search、ai-input 和 ai-train,把 search 定義為「建立搜尋索引並提供搜尋結果」,同時寫明「search 不包括提供 AI 生成的搜尋摘要」。4 按其作者自己的說法,它表達的是偏好,而不是強制執行。然後把四件事寫下來:你選的那個結果、你動過的每一個令牌、日期,以及每家廠商在文件裡寫明的延遲。缺了後兩項,你會把抓取延遲讀成效果。

本文無法告訴你的事

沒有人發表過一份乾淨的測量,說明一次封鎖在引用上究竟要付出多少代價。2026 年間出現過一些廠商分析,聲稱被封鎖的出版商保住了大部分引用;它們的頭條百分比互相打架,沒有一份說明了配對設計,也沒有一份達到本課程的出處標準,所以這裡不出現它們的任何數字。真正達標的那份研究並不是為這個問題而做的:Tow 中心挑那二十家出版商,看的是它們對 AI 存取的立場各異,測的是引用準確度而不是引用數量,既沒有配對對照,也沒有前後對比。Cloudflare 關於被封鎖後答案變得「更不具體」的記述,是一份安全調查裡的定性觀察,而處在其核心的指控仍有爭議。另有兩件事未知:本文描述的代理型瀏覽器行為,能否在按週發版的產品裡繼續成立;以及在你封鎖之前引擎已經吃進去的內容,它會拿它怎麼辦。請把這筆交易的方向當作證據充分,把它的量級當作尚未測量(核查於 2026 年 8 月 30 日)。

產品在哪裡派得上用場,在哪裡派不上

這個決定沒有一處需要軟體。把你的 robots.txt 對照各家廠商文件裡的令牌讀一遍是二十分鐘,確認你的伺服器實際回傳什麼是每個令牌一次抓取,而讀爬蟲日誌會告訴你到底是誰真的來過。至於你願意拿什麼去換,那是一場和管收入的人之間的對話。Bavior 不改你的 robots.txt,不管理你的付費牆,無法讓一個被封鎖的頁面變得可抓取,也無法告訴你一次封鎖讓你損失了什麼,因為那個反事實不在任何人的資料裡。工具能做的是測量那一半:Bavior 按排程把一組固定的 prompt 跑遍五個引擎,並記錄每條答案引用了哪些來源,你正是這樣才會注意到,檔案改了之後,同一批 prompt 開始引用一份經銷商列表而不是你;而當被引用的來源是一串正在進行的討論串時,它會用你掌控的帳號草擬一則回覆,任何內容送出之前都要先由你審核。免費 AI 能見度檢測免費 GEO 健檢不需要付費方案;付費方案為按月付費每月 $99 起,或按年付費每月 $79.17(截至 2026 年 8 月 30 日)。

出處,全部核查於 2026 年 8 月 30 日
  1. Jaźwińska、Chandrasekar,Tow 中心,《AI Search Has a Citation Problem》,2025 年 3 月 6 日;八個工具、二十家出版商、一千六百條查詢:cjr.org/tow_center
  2. Chandrasekar、Jaźwińska,Tow 中心,《How AI Browsers Sneak Past Blockers and Paywalls》,2025 年 10 月 30 日;代理型瀏覽器與付費牆類型:cjr.org/analysis
  3. Corral、Singhal、Mitchell、Tatoris,Cloudflare,《Perplexity is using stealth, undeclared crawlers to evade website no-crawl directives》,2025 年 8 月 4 日;該廠商 2025 年 8 月 5 日的否認在此不作連結:blog.cloudflare.com
  4. Allen,Cloudflare,《Giving users choice with Cloudflare’s new Content Signals Policy》,2025 年 9 月 24 日:blog.cloudflare.com/content-signals-policy
  5. OpenAI,《Overview of OpenAI Crawlers》(OAI-SearchBot、ChatGPT-User,以及約 24 小時的調整窗口;第一方):developers.openai.com/api/docs/bots
  6. Anthropic,《Does Anthropic crawl data from the web, and how can site owners block the crawler?》,更新於 2026 年 4 月 7 日(Claude-User、Claude-SearchBot 與 IP 封鎖;第一方):support.claude.com/en/articles/8896518
  7. Perplexity,《Perplexity Crawlers》(Perplexity-User,以及 24 小時的窗口;第一方):docs.perplexity.ai/guides/bots
  8. Google Search Central,《AI features and your website》,最後更新於 2025 年 12 月 10 日(Googlebot 控制聲明、摘要片段控制、重新抓取延遲):developers.google.com/search/docs/appearance/ai-features
  9. Google Search Central,《Structured data for subscription and paywalled content (CreativeWork)》,最後更新於 2025 年 12 月 10 日(isAccessibleForFree、hasPart 與偽裝的區分):developers.google.com/search/docs/appearance/structured-data/paywalled-content
常見問題

你想知道的,都在這裡。

如果我把所有 AI 爬蟲都封鎖,會從 AI 答案裡消失嗎?

不會。在遵守規則的那條路徑上,你確實會離開:OpenAI 的文件寫明,已退出 OAI-SearchBot 的站點不會出現在 ChatGPT 的搜尋回答裡。留下來的是所有不需要你頁面的東西,Tow 中心就實際看到過:某個被 USA Today 封鎖的工具,轉而引用了 Yahoo News 轉載的同一篇文章。你失去的是帶歸因的出現,留下的是沒有歸因的摘述。

付費牆能阻止 AI 系統讀到我的文章嗎?

只有伺服器端付費牆才行,而且就算是它,也擋不住一位已登入讀者手上的 agent。客戶端遮罩會把文字送到瀏覽器再在視覺上蓋住,所以 Tow 中心發現,代理型瀏覽器能讀到一篇九千字的訂閱專屬文章,而同樣兩家公司的對話介面卻拒絕了。如果一個頁面真的不能被讀到,它需要的是身分驗證,而不是一條指令或一層遮罩。

內容授權協議能讓我的品牌被準確引用嗎?

唯一一份公開測試的答案是不能。Tow 中心把「與新聞機構簽訂內容授權協議,並不能保證聊天機器人回答中的引用是準確的」列為其發現之一,它舉的例子是一家既放行搜尋爬蟲、又處在與該公司合作關係之內的出版商,而它的十段摘錄裡只有一段在十次嘗試中被正確辨識。存取權讓準確歸因成為可能,但它並不產生準確歸因。

我該在防火牆上封鎖 AI 爬蟲,而不是寫進 robots.txt 嗎?

動手之前先讀一家廠商的文件。Anthropic 寫明,封鎖其機器人所使用的 IP 位址「可能無法正確生效,也無法持久保證退出,因為這麼做會妨礙我們讀取你的 robots.txt 檔案」。因此一條網路層規則可能讓你既被抓取又不被聽見,因為承載你意願的那份檔案,正是這條規則擋住廠商去讀的東西。

Bavior 編輯部

負責研究與維護 Bavior 關於 Reddit 行銷和 AI 搜尋可見度的所有內容。文中每一個數字都註明了來源出處與查證日期,所有外部連結均非聯盟推廣連結。

發現數字有誤?告訴我們,我們會重新查證:support@bavior.com

封鎖是一場交易,不是一個開關。
先弄清楚你拿什麼換了什麼。

免費試用