首頁/學習 GEO/第 3 階段
AI 搜尋如何運作 · 第 3 階段

AI 搜尋的檢索階段到底發生了什麼?

檢索,是頁面連品質都還沒被評判就已經退出競爭的地方,也是整個領域證據最紮實的地方。下游的一切都由它封頂。

本頁內容
分享本文
分享到 X 分享到 LinkedIn
簡短回答

檢索是這樣一個階段:每一條生成出來的搜尋查詢打到索引或即時抓取器上,再帶回候選文件。它是一道閘門,不是一個排序因子:一個沒被建立索引、抓不到,或與引擎發出的任何查詢都不相關的頁面,在後面每一個階段都是零分,寫得再好也一樣。2026 年一篇預印本發現,AI 答案中被引用的 URL 有 27.1% 連抓都抓不下來,因為不可存取、已被移除,或不是文字。7

關鍵要點
  • 可檢索性替下游的一切封頂:一個進不了候選集的頁面,在選擇與合成階段的機率都是零,文筆再好也一樣。
  • 頁面會在六個位置掉出檢索:索引、robots.txt 令牌、渲染器、失效的 URL、擋在頁面前面的一道門,以及與實際發出的子查詢之間的相關性。
  • 訓練爬蟲與搜尋爬蟲在 Google、OpenAI、Anthropic 和 Apple 的文件裡都是各自獨立的令牌。封鎖訓練那一個不會有任何改變;一條萬用字元的全站禁止,則會把你從所有引擎裡一次移除。
  • 把答案正文放進第一份 HTML 回應裡:關於傳統 AI 爬蟲執行 JavaScript 的唯一一份公開測量,結論是沒有執行,而且沒有人複現過。
定義

檢索階段發生了什麼?

檢索接收扇出產生的每一條查詢,並為它回傳一組候選文件,來源不是預先建好的索引,就是提問當下的即時抓取。這個機制沒有什麼玄妙之處,它就是搜尋,帶著這個詞所有尋常的後果。Google 對自己的 AI 介面就是這麼說的:「我們在 Google 搜尋上的生成式 AI 功能,根植於我們核心的搜尋排序與品質系統」10;而要有資格成為支持連結,頁面「必須已被建立索引,並且有資格帶著摘要出現在 Google 搜尋中,滿足搜尋的技術要求」。1

兩種檢索模式並存,而它們的失效方式不同。以索引為基礎的檢索,意味著那次關鍵的抓取發生在更早以前,可能是幾週前,由某個爬蟲完成,而引擎手上那個版本的你的頁面,就是那次爬蟲看到的樣子。即時檢索則是有個抓取器會在有人提問的當下拉取那個 URL,這讓時效性變得即時,也讓回應太慢、機器人挑戰或一個 403 變得致命,而這些對索引來說從來都不致命。本課程涵蓋的多數系統兩種都跑,用的是不同的 user-agent 令牌。上一個階段決定有多少條獨立查詢會抵達這裡;總覽請看AI 搜尋如何運作

失效方式

頁面在哪些地方悄無聲息地出局?

頁面會在六個不同的位置掉出檢索:索引、robots.txt 令牌、渲染器、URL 本身、擋在它前面的一道門,以及與引擎實際發出的那些子查詢之間的相關性。

這六種情形在你的分析後台裡每一種都看不見,因為一個從未被檢索到的頁面,根本不會產生曝光,也就沒有任何「少掉的曝光」可看。

01

不在索引裡

Google 明訂的要求是:頁面必須已被建立索引,且有資格顯示摘要。一個 noindex、一條 max-snippet 指令,或一個指向別處的 canonical,都會在其他一切被評估之前,就把頁面移出考慮範圍。

02

封鎖錯了機器人

每一家主要廠商都在文件裡把訓練與搜尋分成兩個令牌。封鎖搜尋令牌,會把你從那個引擎的答案裡移除。封鎖訓練令牌通常不會,但有一個已被文件記載的例外:Google-Extended 現在也控制 Gemini Apps 與 Vertex AI 上的接地,禁止它會讓你在那個介面上消失,而 Google 搜尋與 AI Overviews 不受影響。一條全站的萬用字元禁止,則會把兩者一起拿掉。

03

正文要跑完 JavaScript 才存在

關於傳統 AI 爬蟲的唯一一份公開測量發現,它們會抓取 JavaScript 檔案,但不執行。Google、Bing 和 Applebot 會渲染;另外幾家看來不會,所以這個風險是不平均的,而不是普遍的。

04

URL 已失效或已搬家

在某家基礎設施服務商 2024 年 12 月的日誌研究裡,GPTBot 有 34.82% 的抓取打在 404 上、14.36% 打在轉址上,ClaudeBot 有 34.16% 打在 404 上;Googlebot 對應的數字是 8.22% 與 1.49%。6

05

前面擋著一道閘

登入牆、同意提示層、機器人防護挑戰或過嚴的速率限制,都會終結這次抓取。只存在於圖片、影片,或抓取器不會解析的 PDF 裡的內容,也一樣。

06

對被問到的東西都不相關

最安靜的一種。一個頁面可以被完美建立索引、寫得完美,卻與扇出實際發出的任何查詢都不匹配;這種情況下它不是在檢索裡被淘汰,它根本從來就不是候選。

這一批頁面的規模,可以從另一頭量出來。2026 年一篇預印本(經那篇批判性綜述轉述)發現,AI 答案中已經被引用過的 URL 有 27.1% 抓不下來,因為它們不可存取、已被移除或不是文字。7 請把分母看清楚:它量的是第三方研究者能不能抓到一個被引用的 URL,而不是引用它的那個引擎能不能。即便如此,這仍是「好到已經被引用」那批頁面的失敗率;那些根本沒走到這一步的頁面,失敗率必然更高,而沒有人量過。

天花板

為什麼可檢索性是天花板,而不是排序因子?

因為各階段是相乘的:一個不在候選集裡的頁面,在選擇與合成階段的機率都是零,而再多的下游品質,乘上零還是零。這也是為什麼這個領域最強的實驗結果講的是位置與在場,而不是文筆。NeurIPS 2025 的一項基準測試涵蓋六個領域、逾 1,900 條查詢與 16,000 份文件,測了十種對話式 SEO 方法,發現在零售領域裡,把一個來源移到上下文的第一個位置,平均讓它的引用排名往前推 2.77 名,而所測試的最佳內容方法只有 0.36 名;54 個案例中只有 3 個顯著為正。8

2026 年那篇批判性綜述對同一條界線給出了明確評級:「查詢與文件的相關性、以及在上下文中的位置,是主要決定因素」被評為信心,而「一項白帽介入能在多個引擎上持久改善自然可發現性」被評為9 把它讀成一份「力氣該花在哪裡」的排序,結論毫不含糊:先修那道閘門,再去打磨閘門後面的東西。

robots.txt

你到底需要放行哪一個爬蟲?

每一家主要廠商都在文件裡區分了「採集訓練資料的機器人」和「建立搜尋索引的機器人」。把兩者搞混,是最常見的自傷式檢索失敗。

廠商訓練 / 接地令牌搜尋索引令牌封鎖前者會讓你從答案裡消失嗎?
GoogleGoogle-ExtendedGooglebot不會。AI Overviews 取自搜尋索引1
OpenAIGPTBotOAI-SearchBot不會。文件描述了放行其一、禁止另一的做法2
AnthropicClaudeBotClaude-SearchBot不會。文件中是兩個獨立令牌3
AppleApplebot-ExtendedApplebot不會。禁止前者仍可被收錄進搜尋4
Perplexity文件中沒有PerplexityBot其文件表示,使用者觸發的抓取器通常會忽略 robots.txt5

把這四組拆分分別檢查一遍,並且用一次真實抓取來驗證,而不是靠假設,因為兩種最常見的錯誤方向剛好相反。為了不進 AI 答案而禁止訓練令牌,什麼也達不到;而多年前為了別的理由寫下的一條萬用字元全站禁止,會安靜地把每一個 AI 搜尋機器人一次全部移除。也請注意什麼幫不上忙:Google 的文件寫道,「你不需要為了出現在 Google 搜尋(包括它的生成式 AI 功能)而建立新的機器可讀檔案、AI 文字檔、標記或 Markdown,因為 Google 搜尋本身並不使用它們。」10

渲染

引擎會渲染你的 JavaScript 嗎?

取決於引擎,而誠實的結論比通常被轉述的那句話窄得多。Google 會渲染:它的文件寫著「只要 JavaScript 沒有被封鎖,Google 就能處理其中的內容」,而它的 AI 介面跑的就是同一個渲染過的索引。10 Apple 會渲染:「Applebot 可能會在瀏覽器裡渲染你網站的內容。如果 javascript、CSS 和其他資源透過 robots.txt 被封鎖,它可能無法正確渲染內容。」4 代理型瀏覽器會渲染,因為它們本來就是瀏覽器。

至於其餘那些,公開的測量只有一份。2024 年 12 月,一家基礎設施服務商分析了自己的日誌資料,得出結論:主要的 AI 爬蟲都不會渲染 JavaScript。6 此後沒有任何複現或相反的測量被發表過,那套執行偵測的方法從未被描述,也沒有任何 AI 廠商在文件裡對渲染表過態。所以站得住腳的說法是「唯一一份公開測量,來自 2024 年 12 月,沒有發現執行」,而不是「2026 年的 AI 爬蟲無法渲染 JavaScript」。

無論如何,這個修法便宜到根本不需要把爭論解決掉。只要正文出現在第一份 HTML 回應裡,這個問題對任何引擎都不會發生。

排名

排名還決定得了什麼會被檢索嗎?

排名依然是「是否被引用」最強的單一預測因子,而它已經不再充分。發表於 Findings of ACL 2026 的一項 Google AI Overviews 審計,涵蓋 4,706 條查詢、資料採集於 2025 年 9 月,發現 AI Overviews 查閱過的域名裡有 53% 不出現在自然結果前十,27% 連前 100 名都沒有。11 一篇 55,393 條查詢的預印本,資料採集於 2026 年 3 月 13 日至 4 月 21 日,樣本約為前者的十二倍、時間晚了六個月,發現 AI Overview 引述的域名裡有 29.8% 不出現在對應的第一頁上。13 請把它當成一個區間來引用:大約 30% 到 53%,並寫明兩個採集時間窗,而不是從任一項研究裡取一個點值;也請把動詞分清楚,因為 Kirsten 量的是系統「查閱過」的域名,這和它「引用」的域名並不是同一回事。

SIGIR 2026 上一項 11,500 條查詢的研究,量到 Google 自然結果、AI Overviews 與 Gemini 之間 URL 層級的 Jaccard 相似度為 0.11–0.18。12 機制是扇出:檢索是按子查詢跑的,所以在可見問題上毫無排名的頁面,可以在它的某一個部分上排得很準。

請對任何單一的重疊百分比保持懷疑,包括上面這些,因為這個數字完全取決於一個很少被寫明的分母。「有多少比例的 AI 答案裡至少包含一個前十的 URL」和「有多少比例的個別引用來自前十」,是兩個不同的問題;2025 到 2026 年間發表的數字,從大約六分之一到超過四分之三都有,取決於問的是哪一個、什麼時候問,以及樣本是什麼。一個沒有分母也沒有日期的數字,不是測量。站得住腳的綜合判斷是方向性的:前十的排名贏得高頻引用,而長尾裡有很大、而且還在成長的一部分,來自根本沒有排進第一頁的頁面。

本文誠實的邊界

這裡被引用最多的兩個數字,恰恰是最弱的環節。27.1% 抓不下來這個數字出自一篇預印本,不是同儕審查的成果,而且它量的是已經被引用過的 URL,不是一般的網頁。JavaScript 的結論建立在 2024 年 12 月的單一一份日誌研究上,它的執行偵測方法另外發表,而且是單向的:少了一個渲染時的信標,無法區分「不渲染的爬蟲」和「信標被擋掉的爬蟲」。二十個月過去仍然沒有人複現,也沒有任何廠商文件對此表過態,而這些產品在這段期間變化很大。這兩條主張都還沒有定論。本文紮實的部分,是第一方的 robots.txt 令牌拆分,以及 Google 自己的資格聲明,因為它們出自營運這些系統的公司。

產品派得上用場的地方,和派不上的地方

整套檢索體檢都是免費的,大約一小時就能做完:用一個普通的命令列請求抓取每一個重要的 URL,確認答案正文不跑 JavaScript 就在 HTML 裡;把你的 robots.txt 對照上面四組令牌拆分逐一核對;確認頁面已被建立索引且有資格顯示摘要;再把自己的網站爬過一遍,找出 404 與轉址鏈,AI 爬蟲在跟隨這些方面比 Googlebot 差得多。這些都不需要任何工具,也沒有工具能替你去修。Bavior 做的是再下一個階段的事:它按排程把一組固定的 prompt 打到五個引擎上,並記錄每一個答案引用了哪些來源,讓你知道一次檢索層面的修復有沒有改變「出現的是誰」;當被引用的來源是一串正在進行的討論串時,它會用你掌控的帳號草擬一則回覆,任何內容送出之前都要先由你審核。它不會爬你的網站,不會改你的 robots.txt,也無法讓一個被封鎖的頁面變得可檢索。免費 AI 能見度檢測免費 GEO 體檢不需要付費方案;付費方案為按月付費每月 $99 起,或按年付費每月 $79.17(截至 2026 年 8 月 29 日)。

出處,全部核查於 2026 年 8 月 29 日
  1. Google Search Central,〈AI features and your website〉,更新於 2025 年 12 月 10 日(資格條件、Google-Extended、摘要控制;第一方):developers.google.com/search/docs/appearance/ai-features
  2. OpenAI,爬蟲與機器人文件(GPTBot、OAI-SearchBot、ChatGPT-User;第一方):developers.openai.com/api/docs/bots
  3. Anthropic,〈Does Anthropic crawl data from the web?〉(ClaudeBot、Claude-SearchBot、Claude-User;第一方):support.claude.com/en/articles/8896518
  4. Apple,〈About Applebot〉(Applebot、Applebot-Extended、瀏覽器渲染;第一方):support.apple.com/en-us/119829
  5. Perplexity,機器人文件(PerplexityBot、Perplexity-User;第一方):docs.perplexity.ai/guides/bots
  6. Zecchini、Moore、Ubl、Siddle,〈The rise of the AI crawler〉,Vercel,2024 年 12 月 17 日(基礎設施第一方日誌資料):vercel.com/blog/the-rise-of-the-ai-crawler
  7. Allaham 與 Diakopoulos,2026;AI 答案中被引用的 URL 有 27.1% 無法抓取(預印本,經出處 9 的批判性綜述轉述)
  8. Puerto、Gubri、Green、Oh、Yun,〈C-SEO Bench: Does Conversational SEO Work?〉,NeurIPS 2025 Datasets & Benchmarks Track,arXiv:2506.11097:arxiv.org/abs/2506.11097
  9. 〈Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)〉,2026 年 7 月 15 日,arXiv:2607.14035(綜述預印本):arxiv.org/abs/2607.14035
  10. Google Search Central,〈Google’s Guide to Optimizing for Generative AI Features on Google Search〉,更新於 2026 年 7 月 10 日(「根植於」那一句、JavaScript 處理、不需要 AI 文字檔;第一方):developers.google.com/search/docs/fundamentals/ai-optimization-guide
  11. Kirsten 等,Findings of ACL 2026;對 Google AI Overviews 的 4,706 條查詢審計,資料採集於 2025 年 9 月,涵蓋美國與德國;原文為「on average 53% (27%) of domains that AIO consults are not contained in top-10 (top-100) Organic search results」:aclanthology.org/2026.findings-acl.526
  12. Grossman 等,SIGIR 2026;11,500 條查詢;Google 自然結果、AI Overviews 與 Gemini 之間 URL 層級的 Jaccard 為 0.11–0.18:arxiv.org/abs/2604.27790
  13. Xu、Iqbal 與 Montgomery,2026;55,393 條熱門查詢,採集於 2026 年 3 月 13 日至 4 月 21 日;原文為「29.8% of AIO reference domains do not appear anywhere on the corresponding first page」(預印本):arxiv.org/abs/2605.14021
常見問題

你想知道的,都在這裡。

如果我封鎖 GPTBot,會從 ChatGPT 的答案裡消失嗎?

不會。GPTBot 和 OAI-SearchBot 是分別記載在文件裡的兩個令牌,而決定你會不會出現在「有搜尋支撐的答案」裡的,是搜尋索引爬蟲。OpenAI 自己的機器人文件就描述了「放行 OAI-SearchBot 以出現在搜尋結果中,同時禁止 GPTBot」的做法。同樣的拆分在 Google(Google-Extended 對 Googlebot)、Anthropic(ClaudeBot 對 Claude-SearchBot)和 Apple(Applebot-Extended 對 Applebot)都存在。真正會把你從每一個 AI 答案裡一次移除的,是一條萬用字元的全站禁止規則,而它通常是從一份舊 robots.txt 繼承來的,不是有意選的。

我的網站一定要伺服器端渲染,才能出現在 AI 答案裡嗎?

取決於引擎,而把正文放進第一份 HTML,就能讓這個問題對所有引擎都消失。Google 表示它「只要 JavaScript 沒有被封鎖就能處理其中的內容」,Apple 也在文件裡寫明 Applebot 會在瀏覽器裡渲染;代理型瀏覽器會渲染,因為它們本來就是瀏覽器。至於傳統的 AI 爬蟲,唯一一份公開測量,也就是某家基礎設施服務商 2024 年 12 月的日誌研究,發現它們會抓取 JavaScript 檔案但不執行;文中那個 5.69 億次的 GPTBot 數字是每月請求量,不是渲染測試的樣本數,後者那篇文章從未給出。這份研究至今沒有被複現,也沒有被推翻,所以請把它當作現有最好的證據,而不是已有定論的事實。

要被 AI 搜尋引用,我還需要在 Google 上有排名嗎?

排名依然是「是否被引用」最強的單一預測因子,但它本身已經不夠了。發表於 Findings of ACL 2026 的一項 Google AI Overviews 4,706 條查詢審計發現,AI Overviews 查閱過的域名中,平均有 53% 不出現在該查詢的自然結果前十,27% 連前 100 名都沒有。機制是查詢扇出:檢索是按子查詢跑的,所以一個頁面可以因為問題的某一部分被檢索到,卻在整個問題上毫無排名。請把前十的排名理解為贏得高頻引用的東西,把子問題的覆蓋理解為贏得長尾的東西。

為什麼一個已被建立索引、又寫得好的頁面,還是從來沒被引用過?

最常見的原因,是它沒有匹配上引擎實際發出的任何一條查詢。檢索是按扇出的子查詢跑的,不是按原始問題跑的,所以一個頁面可以既被建立索引、又快、又寫得好、又完全切題,卻對被搜尋的任何東西都構不成候選。另一個常見原因是抓取失敗,而不是品質判斷:2026 年一篇預印本發現,AI 答案已經引用過的 URL 中有 27.1% 根本抓不下來,因為不可存取、已被移除或不是文字。這兩種失敗在你的分析後台裡都不會產生任何訊號,所以它們才會一直存在。

Bavior 編輯部

負責研究與維護 Bavior 關於 Reddit 行銷和 AI 搜尋可見度的所有內容。文中每一個數字都註明了來源出處與查證日期,所有外部連結均非聯盟推廣連結。

發現數字有誤?告訴我們,我們會重新查證:support@bavior.com

可檢索性就是你的天花板。
先弄清楚它在哪一層。

免費試用