首頁/學習 GEO/可抓取性與收錄
GEO 與 SEO · 專題

可抓取性與收錄,為什麼決定了你能不能被引用?

因為可檢索性是其餘一切的上限。Google 為它的 AI 介面只寫明一條要求,而那是一條收錄要求;2026 年一項審計發現,AI 答案引用的 URL 有 27.1% 連取回都取不到;而且任何地方都不存在一個可供提交的獨立 AI 索引。

本頁內容
分享本文
分享到 X 分享到 LinkedIn
簡短回答

可抓取性與收錄決定你是否具備資格,因此它們是其下每一項內容手法的上限。Google 的文件用一句話寫明這道門檻,「頁面必須被收錄,並且有資格帶摘要出現在 Google 搜尋中,滿足搜尋的技術要求」,並補充說沒有額外的技術要求,也沒有需要另外加上的特殊結構化資料。1 2026 年一項審計發現,AI 答案引用的 URL 有 27.1% 根本沒被抓下來,原因是無法存取、已被移除,或者不是文字。2

關鍵要點
  • Google 的門檻就是那條老門檻:被收錄、有資格帶摘要、技術上過關。它的文件寫明不需要任何 AI 專用檔案、標記或 schema,而且搜尋會忽略 llms.txt。
  • 不存在 AI 索引,也沒有提交端點。AI Overviews 與 AI Mode 跑在搜尋索引上,而微軟的公開網站接地只能用已被 Bing 收錄的頁面。
  • 封鎖訓練令牌不會改變 AI 答案裡的任何東西。封鎖搜尋令牌才會把你從那個引擎裡拿掉,而一條一刀切的 Disallow 會把你從所有引擎裡一次拿掉。
  • robots.txt 只是請求,真正執行的是你的防火牆。請用各家廠商公布的 IP 位址範圍來核驗爬蟲,而不是 user-agent 字串,並把答案的文字放進第一個 HTML 回應裡。
第一方文件

一個頁面要出現在 AI Overviews 裡,Google 究竟要求什麼?

Google 只要求一件事,而且那是一條收錄要求:「頁面必須被收錄,並且有資格帶摘要出現在 Google 搜尋中,滿足搜尋的技術要求。」同一組文件還寫道,生成式功能「植根於我們核心的搜尋排名與品質系統」,「要出現在 AI Overviews 或 AI Mode 中沒有額外要求,也不需要其他特殊優化」,以及「你不需要為了出現在這些功能裡而建立新的機器可讀檔案、AI 文字檔或標記。也沒有需要額外加上的 schema.org 結構化資料。」1

把這段話當成邊界來讀,而不是鼓勵。它一次排除了一整類付費建議:AI 專用標記、AI 專用檔案、AI 專用提交。負擔因此回到可被收錄、可被抓取、有資格帶摘要這些常規工作上。同一份文件寫明 Google 搜尋會忽略 llms.txt,等於用它本想影響的那個引擎的權威,讓過去兩年最流行的 AI 檔案提案就此退場。

搜尋側有兩項控制項確實有用,值得記準:nosnippetmax-snippetdata-nosnippet 限制 Google 可以從你的頁面展示什麼,noindex 則把頁面整個移除。封鎖訓練爬蟲不在這份清單裡,理由見第四節。

並不存在的端點

有沒有一個可以提交的獨立 AI 索引?

不存在這樣的索引,也沒有任何引擎公布過對應的提交端點。每一個主流答案引擎,接地時用的都是它自己已在運營的常規網頁索引,或者某個搜尋夥伴的索引。Google 的 AI Overviews 與 AI Mode 跑在搜尋索引上,Gemini 使用 Googlebot 的基礎設施,而微軟關於公開網站接地的文件寫明,「需要驗證的 URL,或未被 Bing 收錄的 URL,都不受支援」。11 OpenAI、Anthropic 和 Perplexity 各自公布了一個為搜尋抓取頁面的爬蟲令牌,以及一個獨立的訓練令牌。345

實際結果是:「進入 AI」沒有一個獨立的准入步驟。你的頁面進入這個池子的方式和以前一樣:爬蟲抓到它、索引留下它、檢索環節選中它。如果有人向創業者兜售「AI 收錄」服務,能結束這場對話的問題只有一個:它把資料 POST 到哪個端點。這正是GEO 與 SEO 這個階段放在每一項內容手法底下的前提;而真正新增的雜務只有一件:好幾個行為各異的爬蟲取代了單一的主導爬蟲,所以一份為 Googlebot 寫的 robots.txt,已經無法描述你的全部暴露面。

失敗率

可檢索性到底多常失敗?

頻繁到值得當成第一件要查的事:2026 年一篇預印本(經那篇批判性綜述轉述)發現,AI 答案中已被引用的 URL 有 27.1% 沒被抓下來,原因是無法存取、已被移除或不是文字;同一項工作另外把成功取回的 19,154 個頁面中約 16% 標記為 AI 生成。2 分母值得點名:它測的是第三方研究者能不能取回一個被引用的 URL,而不是引用它的那個引擎能不能。失效模式都很平淡:登入牆、同意彈層、擋機器人的 WAF 規則、只有圖片的頁面、如今已經 404 的 URL。每一條都是一張技術工單,不是一個內容決策。

關於存取,有兩個反方向的錯誤認知。第一個是付費牆能把你擋在 AI 答案之外:一項涵蓋 10 萬條美國長尾新聞查詢、採集於 2025 年 4 月的廠商研究發現,某大報在 AI Overview 中的引用有超過 96% 指向付費牆內的內容,因為 Google 的彈性抽樣讓 Googlebot 得以進入付費牆之內。此為廠商發布;依本課程的出處規則,只描述、不連結。

第二個是封鎖爬蟲能保護你不被摘要。哥倫比亞大學 Tow 中心在 2025 年 10 月做了測試,發現代理型瀏覽器取回了一篇 9,000 字的僅限訂閱者文章,而同樣那兩個產品的標準介面取不到,因為出版方封鎖的是那些爬蟲,而這些瀏覽器在伺服器日誌裡與 Chrome 無法區分。在封鎖確實擋住的場合,該 Agent「拼出了一份複合摘要,取材自關於該文的推文、轉載版本、其他媒體的引用,以及全網的相關報導」。6 封鎖改變的是流量歸誰,而不是把你從答案裡移除。

機器人令牌

robots.txt 裡哪個令牌才真的會把你從 AI 答案裡拿掉?

是搜尋令牌,絕不是訓練令牌,而且每一家廠商都用自己的措辭把這個區分寫進了文件。

引擎訓練令牌搜尋令牌封鎖訓練會把你拿掉嗎?
GoogleGoogle-ExtendedGooglebot不會。「Google-Extended 不影響網站在 Google 搜尋中的收錄」
OpenAIGPTBotOAI-SearchBot不會。網站可以放行 OAI-SearchBot,同時禁止 GPTBot
AnthropicClaudeBotClaude-SearchBot不會。獨立令牌,分別有文件
AppleApplebot-ExtendedApplebot不會。「禁止 Applebot-Extended 的網頁仍可被收入搜尋結果」
Perplexity未公布PerplexityBot依其自身文件,Perplexity-User「一般會忽略 robots.txt 規則」

由此得出的規則很短:封鎖訓練令牌,對你在 AI 答案裡的出現毫無影響;封鎖搜尋令牌,才會把你從那個引擎的答案裡拿掉。兩個方向的錯誤都很常見。一邊禁止 GPTBot、一邊指望留在 ChatGPT 的搜尋結果裡,等於什麼也沒做,因為那個介面是用 OAI-SearchBot 抓取的。一邊禁止 Google-Extended、一邊擔心 AI Overviews,同樣什麼也沒做,因為 AI Overviews 取用的是由 Googlebot 填滿的搜尋索引。1345

會悄悄咬人的是那條一刀切的規則。多年前為了防採集寫下的萬用 Disallow,會一次把所有 AI 搜尋機器人全部擋掉;那些廣為流傳的「有多少網站封鎖 AI 爬蟲」統計之所以被灌水,原因也在這裡,因為那些計數包含了從來就不是針對 AI 的萬用規則。某邊緣網路 2025 年度回顧的獨立基礎設施資料顯示,2025 年整年 AI 機器人佔 HTML 請求的 4.2%,Googlebot 為 4.5%,而由使用者觸發的抓取在這一年裡成長超過十五倍。7 請把那四個令牌分別檢查一遍,並跳過 llms.txt:Google 的文件說搜尋會忽略它。

真正的執行方

你要怎麼核驗伺服器實際放進來的是哪些爬蟲?

robots.txt 是一個請求,真正執行的是你的伺服器,而兩者不一致的頻率比任何人預期的都高。一條防機器人規則、一個限流器,或一條按地區封鎖的規則,都可能把 robots.txt 明確放行的爬蟲丟掉,而且沒有任何地方會報告這件事,因為一次從未完成的抓取,不會留下任何可供你發現缺失的展示紀錄。這道缺口和上面那個 27.1% 屬於同一類,而且與引擎的內部行為不同,它完全在你自己能檢查的範圍內。

要查就查存取日誌,而不是設定檔;要按位址核對,而不是按名字。上表裡的每一家廠商,都正是為此公布了機器可讀的 IP 位址範圍。OpenAI 為 OAI-SearchBot、GPTBot 和 ChatGPT-User 各列出一份 JSON 檔案。3 Perplexity 為 PerplexityBot 和 Perplexity-User 各公布一份,並要防火牆維運方以那些端點為準。5 Google 公布了 common-crawlers.json,另有針對特例爬蟲與使用者觸發抓取器的獨立檔案,同時記錄了一種手動做法:對發起抓取的位址做反向 DNS 查詢,結果必須解析到 googlebot.com、google.com 或 googleusercontent.com,再用一次正向查詢回到同一個位址。10

有兩個結論值得據此行動。user-agent 字串不是證據,所以按名字放行等於放行任何願意送出那串字的東西,而按名字封鎖也擋不住任何要緊的東西。另外,如果某個搜尋令牌整整一週都沒有一次成功抓取,而頁面確實在線且已被放行,那麼封鎖就落在 robots.txt 與你的源站之間,這是一張防火牆工單,不是一張 SEO 工單。

渲染

AI 爬蟲會執行你的 JavaScript 嗎?

有些會,有些則兩個方向都沒有文件;誠實的說法是:唯一已發表的測量來自 2024 年 12 月,而它沒有觀察到執行。那次測量來自某基礎設施供應商發文前一個月的第一方日誌資料,文中寫道「目前沒有任何主流 AI 爬蟲會渲染 JavaScript」,同時指出這些爬蟲確實會抓取 JavaScript 檔案,只是不執行。8 此後既沒有複現,也沒有相反的測量發表;而 OpenAI、Anthropic 與 Perplexity 的爬蟲文件,對渲染兩個方向都隻字未提。這份沉默本身就是發現。

有三方是有文件說明會渲染的。Google 寫明它「只要沒有被封鎖,就能處理 JavaScript 裡的內容」,而 AI Overviews 與 AI Mode 就跑在那個已渲染的索引上。1 Apple 寫明「Applebot 可能會在瀏覽器中渲染你網站的內容」,並警告若在 robots.txt 裡封鎖 JavaScript 與 CSS,「它可能無法正確渲染內容」。9 而這兩家公司推出的代理型瀏覽器是完整的 Chromium 版本。任何「AI 看不到你的 JavaScript」的一刀切說法,對這一整類都是錯的。

所以這是一個可以便宜消除的風險,而不是一場需要打贏的辯論。如果讀者需要的文字就在第一個 HTML 回應裡,這個問題在任何引擎上都不會出現。同樣的邏輯適用於 URL 衛生,而 2024 年 12 月那份資料在這一點上格外直白:GPTBot 有 34.82% 的抓取花在 404 上、14.36% 花在轉址上,ClaudeBot 有 34.16% 花在 404 上,Googlebot 則分別是 8.22% 與 1.49%。過期的 sitemap 與轉址鏈,燒掉的 AI 爬蟲注意力比例,遠高於燒掉 Google 的。

本頁誠實的局限

JavaScript 那個結論來源單一且已過時:只有 2024 年 12 月的一篇文章,其偵測執行的方法另外發表過,是在渲染時注入信標,屬於單向測試:信標沒出現,無法區分不渲染的爬蟲和信標被封鎖或逾時的爬蟲,而且此後二十個月都沒有複現。請把它當成現有最好的證據,而不是關於 2026 年的事實。27.1% 這個抓不下來的數字,有一個更微妙的局限:它測的是第三方研究者能不能取回一個被引用的 URL,這與引用它的那個引擎能不能取回並不相同,因為引擎可能用的是快取副本或自己的索引。兩個數字在方向上都有用,但都不該被當成定律引用。

產品在哪裡派得上用場,在哪裡派不上

這個主題請完全不用軟體解決;那份清單就是一個下午的活。確認你的關鍵頁面已被收錄且有資格帶摘要,以匿名客戶端各抓取一次、檢查文字就在 HTML 回應裡,把 robots.txt 裡那四個搜尋令牌分別讀一遍,再清掉內部連結仍指向的 404 與轉址鏈。這些事 Bavior 一件都不做:沒有爬蟲、沒有索引,也不對你的伺服器做技術審計。它做的事在這之後,等頁面可被檢索了:它按排程把一組固定的 prompt 跑遍五個引擎,並記錄每一條答案引用了哪些來源。免費 GEO 健檢能給你這條基線;付費方案為按月付費每月 $99 起,或按年付費每月 $79.17(截至 2026 年 8 月 29 日)。

出處,全部核查於 2026 年 8 月 29 日
  1. Google Search Central,《AI features and your website》(更新於 2025 年 12 月 10 日)與 AI 優化指南(更新於 2026 年 7 月 10 日)(第一方;收錄要求、無需特殊標記的陳述、llms.txt、JavaScript 處理):developers.google.com/search/docs/appearance/ai-featuresAI 優化指南。Google-Extended 的文件見 google-common-crawlers
  2. Allaham 與 Diakopoulos,2026 預印本;AI 答案中被引用的 URL 有 27.1% 因無法存取、已被移除或不是文字而未被抓取;成功取回的 19,154 個頁面中約 16% 被標記為 AI 生成。經 2026 年批判性綜述 §8.3 轉引,arXiv:2607.14035:arxiv.org/abs/2607.14035
  3. OpenAI,爬蟲文件(GPTBot、OAI-SearchBot、ChatGPT-User,以及各令牌的 IP 位址範圍檔案):developers.openai.com/api/docs/bots
  4. Anthropic,《Does Anthropic crawl data from the web?》(ClaudeBot、Claude-SearchBot、Claude-User):support.claude.com/en/articles/8896518
  5. Perplexity,機器人文件(PerplexityBot、Perplexity-User,以及公布的 IP 位址範圍):docs.perplexity.ai/guides/bots
  6. 哥倫比亞大學 Tow 數位新聞中心,《How AI browsers sneak past blockers and paywalls》,2025 年 10 月 30 日:cjr.org
  7. Cloudflare Radar 2025 年度回顧,資料區間 2025 年 1 月 1 日至 12 月 2 日;AI 機器人佔 HTML 請求 4.2%,Googlebot 為 4.5%,使用者觸發的抓取成長超過 15×:blog.cloudflare.com/radar-2025-year-in-review
  8. Vercel × MERJ,《The rise of the AI crawler》,2024 年 12 月 17 日;發文前一個月的第一方日誌資料;文中 5.69 億次 GPTBot 與 3.7 億次 ClaudeBot 是請求量,不是渲染測試的樣本量,該文並未說明樣本量;404 與轉址佔比:vercel.com/blog/the-rise-of-the-ai-crawler
  9. Apple,《About Applebot》(在瀏覽器中渲染;Applebot-Extended):support.apple.com/en-us/119829
  10. Google Search Central,《Verifying Googlebot and other Google crawlers》(反向與正向 DNS 核驗;爬蟲 IP 位址範圍 JSON 檔案):developers.google.com/search/docs/crawling-indexing/verifying-googlebot
  11. 微軟,《Add a public website as a knowledge source》,Copilot Studio,更新於 2026 年 7 月 21 日(需要驗證或未被 Bing 收錄的 URL 不受支援):learn.microsoft.com/en-us/microsoft-copilot-studio/knowledge-add-public-website
常見問題

你想知道的,都在這裡。

想出現在 Google AI Overviews 裡,需要做什麼特別的事嗎?

不需要,而且 Google 直接寫明:「要出現在 AI Overviews 或 AI Mode 中沒有額外要求,也不需要其他特殊優化。」唯一寫明的要求是:「頁面必須被收錄,並且有資格帶摘要出現在 Google 搜尋中,滿足搜尋的技術要求。」同一份文件還說,你不需要新的機器可讀檔案、AI 文字檔或標記,也沒有需要額外加上的 schema.org 結構化資料。任何以 AI 專用標記名義販售的東西,都與引擎自己的文件相矛盾。

有沒有一個可以提交我網站的 AI 索引?

沒有,也沒有任何引擎公布過這樣的提交端點。Google 的 AI Overviews 與 AI Mode 跑在搜尋索引上,Gemini 使用 Googlebot 的基礎設施;微軟 Copilot Studio 的文件寫明,需要驗證或未被 Bing 收錄的 URL,不能作為公開網站知識來源;OpenAI、Anthropic 和 Perplexity 各自公布了一個按常規方式抓取頁面的搜尋爬蟲。你的頁面進入這個池子的方式和以前完全一樣:爬蟲抓到它、索引留下它、檢索環節選中它。如果有服務號稱能做「AI 收錄」,請問它把資料 POST 到哪個端點。

封鎖 GPTBot 會把我從 ChatGPT 的答案裡拿掉嗎?

不會。GPTBot 是訓練爬蟲,而為搜尋結果抓取頁面的是 OAI-SearchBot。OpenAI 自己的文件寫明,站長可以在放行 OAI-SearchBot 以便出現在搜尋結果中的同時,禁止 GPTBot。同樣的區分在別處也存在:Google-Extended 對 Googlebot、ClaudeBot 對 Claude-SearchBot、Applebot-Extended 對 Applebot。Google 明白寫著「Google-Extended 不影響網站在 Google 搜尋中的收錄」。真正會一次把你從所有 AI 搜尋機器人面前拿掉的,是一條一刀切的 Disallow。

我要怎麼確認打到伺服器上的爬蟲,真的是它自稱的那一個?

拿發起抓取的 IP 位址去比對廠商公布的位址範圍,永遠不要憑 user-agent 字串,因為任何人都能送出那串字。OpenAI 為 OAI-SearchBot、GPTBot 和 ChatGPT-User 各公布一份位址範圍的 JSON 檔案;Perplexity 為 PerplexityBot 和 Perplexity-User 公布位址範圍,並要防火牆維運方以那些端點為準;Google 公布了 common-crawlers.json,另有針對特例爬蟲與使用者觸發抓取器的獨立檔案,並記錄了反向 DNS 查詢的做法:結果必須解析到 googlebot.com、google.com 或 googleusercontent.com,再由一次回到同一位址的正向查詢加以確認。

AI 爬蟲能讀取靠 JavaScript 渲染的頁面嗎?

取決於引擎,而且證據比那些語氣篤定的部落格文章要薄得多。唯一已發表的測量,是某基礎設施供應商 2024 年 12 月的日誌研究,結論是主流 AI 爬蟲都不渲染 JavaScript,雖然它們確實會抓取 JavaScript 檔案。此後沒有出現複現研究,而 OpenAI、Anthropic 和 Perplexity 在兩個方向上都沒有任何文件。Google 在未被封鎖時會處理 JavaScript,Apple 的文件說明 Applebot 會在瀏覽器中渲染,而代理型瀏覽器本身就是 Chromium 版本,當然會執行它。

付費牆能把我的內容擋在 AI 答案之外嗎?

不能,而且這個問題的兩側證據都指向相反方向。一項涵蓋 10 萬條美國長尾新聞查詢、採集於 2025 年 4 月的廠商研究發現,某大報在 AI Overview 中的引用有超過 96% 指向付費牆內的內容,因為 Google 的彈性抽樣讓 Googlebot 得以進入付費牆之內。而當爬蟲真的被封鎖時,Tow 中心 2025 年 10 月的測試發現,引擎會改用轉載副本、第三方報導與社群貼文拼出一份複合摘要。封鎖改變的是流量歸誰,而不是你會不會出現。

Bavior 編輯部

負責研究與維護 Bavior 關於 Reddit 行銷和 AI 搜尋可見度的所有內容。文中每一個數字都註明了來源出處與查證日期,所有外部連結均非聯盟推廣連結。

發現數字有誤?告訴我們,我們會重新查證:support@bavior.com

先做到可檢索,再談可引用。
今天就把那四個令牌查一遍。

免費試用