首頁/學習 GEO/檢查清單
技術 GEO · 綜合

技術 GEO 檢查清單,按你該跑的順序排好。

三層共十項檢查。每一項都寫明要跑什麼、通過和失敗各長什麼樣,以及失敗時該讀哪一篇。順序不是裝飾:這些項目彼此並不獨立。

本頁內容
分享本文
分享到 X 分享到 LinkedIn
簡短回答

技術檢查清單是三層共十項檢查,按最便宜的先跑:四項靠一次普通抓取就能定論,三項只有你自己的伺服器日誌能回答,三項則是決策而不是修復。順序本身承載著論證,因為這些項目彼此並不獨立:越靠上的失敗,會讓它下面的每一次測量都無法解讀。在 AI 答案已經引用過的 URL 裡,有 27.1% 根本抓不下來,因為無法存取、已刪除或不是文字;這就是引擎已經挑中的那批頁面身上,第一層的失敗率。8

關鍵要點
  • 第一層是對每個重要 URL 做一次抓取:狀態碼、原始回應裡的正文、按搜尋側令牌逐個求解的 robots 結果,以及摘要指令。這四項沒過之前,它下面的一切都不可信。
  • 第二層之所以存在,是因為第一層測的是伺服器被設定成要做什麼,而日誌記錄的是它做了什麼。機器人管理規則的效力高於 robots.txt,而且它不會通知你。
  • 第三層不是修復。閘門、使用者觸發型抓取器和最後修改時間是否屬實,都是政策判斷,對新聞站正確的答案,對文件站就是錯的。
  • 全部通過買到的是資格,不是引用。有兩家廠商在文件裡寫明 robots.txt 的改動大約需要 24 小時才會被反映,所以請隔天再複查。
順序

為什麼這份清單的順序就是清單本身?

一份清單只有在項目按依賴關係排序時才有價值,而技術類項目之間的依賴格外重。下面十項裡有四項,一次命令列抓取就能定論。三項需要留存一個月的伺服器日誌,以及一個會查日誌的人。三項根本不是修復:它們是關於你希望別人的機器能讀到什麼的決策。按這個順序跑不是為了整齊,而是因為只有在這個順序下,結果才有意義。

依賴只朝一個方向流。如果一次普通抓取回來的是一道挑戰而不是頁面,那麼之後你查的每一份日誌都會是沉默,而這份沉默的原因跟引擎對你有沒有興趣毫無關係。如果 robots.txt 禁掉了搜尋側令牌,一個月的抓取資料讀起來就像冷淡,團隊於是得出 AI 引擎不理會自己這個品類的結論,而事實是站點自己叫它們別來。如果正文只在水合之後才存在,那麼一次引用測量測的是 JavaScript 打包檔,而不是文字。這三種都是長得跟真陰性一模一樣的假陰性,所以清單靠上的失敗是一條停止指令,而不是一條留著往下帶的備註。

成本指向同一個方向。第一層是一台筆電加十分鐘。第二層要佔掉一個人一天,還需要你未必有的日誌留存。第三層要開一次會。便宜的檢查為貴的檢查把關,因此對第一層失敗的反應是:修掉它,等廠商的系統跟上,再從頭跑一遍。每一項背後的道理都在它自己的文章裡,並從該項目直接連出;這一頁新增的是順序和執行方式。

第一層

一次普通抓取,十分鐘裡能定下什麼?

四項檢查,每項一條指令,不需要工具也不需要帳號。對每一個你希望被引用的 URL 都跑一遍,而不是只跑首頁。

01

各令牌下的狀態碼

用每個搜尋側 user agent 對每個 URL 抓一次:curl -sIL -A OAI-SearchBot https://example.com/page。通過是 200,且最多一跳轉址。失敗是 403、429、503、一層插頁,或者一條轉址鏈。失敗時去讀付費牆與封鎖

02

原始回應裡的正文

把原始回應存成檔案,在裡面找一句你希望被引用的話。通過是這句話就在伺服器送回的位元組裡。失敗是它只有在頁面於瀏覽器裡跑過之後才出現。失敗時去讀JavaScript 會執行嗎

03

robots.txt 結果,逐個令牌

對 Googlebot、OAI-SearchBot3、Claude-SearchBot4、PerplexityBot5 和 Applebot6 分別求解生效結果,再用一次真實抓取逐個確認。通過是每個搜尋側令牌都被放行;失敗通常是一條繼承下來的萬用字元全站禁止。失敗時去讀爬蟲令牌

04

已收錄且可帶摘要展示

Google 明示的要求是,頁面「必須已被收錄,並且有資格帶摘要出現在 Google 搜尋裡」。1 通過是一個自指的 canonical,且 head 和回應標頭裡都沒有 noindex、nosnippet 或 max-snippet 指令。失敗時去讀可抓取性與收錄

結果要按 URL 記錄,不要按站點記錄。首頁幾乎總是四項全過;真正承載你答案的深層頁面才是第一層出問題的地方,而那些正是引擎需要的頁面。四項裡有兩項也常常一起失敗,因為客戶端渲染的應用往往坐在一套帶機器人規則的邊緣設定後面。這為什麼會給後面所有工作封頂,在可檢索性上限裡論證。

第二層

哪些問題只有你自己的日誌能回答?

第一層測的是伺服器應該做什麼。日誌記錄的是它實際做了什麼,而這兩者不一致的頻率比任何人預期的都高。

05

每個令牌每天的到訪

把三十天的存取日誌按 user agent 過濾,對每個搜尋側令牌分別計數。通過是每個你放行的令牌都有非零且大致平穩的計數。失敗是某個 robots.txt 允許的令牌計數為零:在檔案和日誌之間有東西把它們丟掉了。然後去讀AI 抓取流量

06

被浪費掉的抓取

統計每個令牌的請求裡回傳 404 或轉址的占比。某基礎設施服務商 2024 年 12 月的日誌研究報告,ChatGPT 爬蟲有 34.82%、Claude 有 34.16% 的抓取落在 404 上,而 Googlebot 是 8.22%。7 通過是你更接近 Googlebot;有差距就指向過期的網站地圖或已退役的 URL。

07

無聲的挑戰

按令牌找出 403、429 和 503 回應,而且要讀防火牆自己的事件日誌,不能只看 Web 伺服器的。Perplexity 在文件裡寫明,站點所有者可能需要在 Web 應用防火牆裡明確放行它的機器人。5 通過是被放行的令牌上沒有任何挑戰事件。

第 07 項是最常和紙面設定對不上的一項。robots 指令是一個請求,守規矩的爬蟲才會遵守;機器人管理規則則是一次強制,它在你的應用看到任何東西之前就已經觸發,而且通常由另一個團隊維護。兩者衝突時贏的是強制,於是 robots 檔案可以錯上好幾個月,卻不產生任何會有人去看的症狀。有個團隊圍繞一次 robots.txt 修正做了前後對比,看到抓取量紋絲不動,最後在邊緣的託管機器人規則集裡找到原因,而不是在他們剛改過的那個檔案裡。這些資料該怎麼讀,以及怎麼分辨一個真爬蟲和一個只是頂著它名字的東西,在讀爬蟲日誌裡講。

第三層

剩下的哪些是決策而不是修復?

最後三項沒有任何清單能提供的正確答案。它們需要一個能說清這個站是幹什麼用的人。

08

閘門:有意的還是順手加的

明確決定哪些內容放在登入、付費牆或同意牆後面,並把這個決定寫下來。通過是這道閘有人選過、有人負責。失敗是一道沒人選過的閘,通常是標籤管理器帶進來的同意插頁。這筆取捨在付費牆與封鎖裡論證。

09

使用者觸發型抓取器

ChatGPT-User、Claude-User 和 Perplexity-User 之所以抓取,是因為有人問了,不是按抓取排程走;Perplexity 在文件裡寫明「既然這次抓取是使用者要求的,這個抓取器一般會忽略 robots.txt 規則」。5 通過是你已經決定好要怎麼對待它們。把它們當爬蟲看是一個選擇,不是預設。

10

一個屬實的最後修改時間

把 Last-Modified 標頭和任何對外發布的修改時間,跟真正的最後一次編輯對一對。通過是它們一致。失敗是建置流程把今天蓋在每一個檔案上,這會讓新鮮度在你整個網域上失去意義,而不只是在某一頁上。

這三項都沒有腳本能算出來的通過標準,這正是它們排在最下面的原因。它們的變動也最不頻繁:第 08 項在商業模式變化時動,第 09 項在廠商發布新文件時動,第 10 項只動一次,等有人把建置流程修好。它們上面的一切都值得排一個週期,因為把那些項目弄壞的,是沒有人標記成這兩者之一的發布與基礎設施變更。

範圍

哪些項目被刻意排除在外?

在清單上,按順序

  • 各搜尋側令牌下的狀態碼
  • 正文出現在原始回應裡
  • 各令牌的 robots.txt 結果
  • 已收錄、canonical 乾淨、允許摘要
  • 你日誌裡各令牌的到訪
  • 各令牌的 404 與轉址占比
  • 沒有無聲的防火牆挑戰
  • 閘門是刻意設的且有人負責
  • 對使用者觸發型抓取器有一套政策
  • 屬實的最後修改時間

不在清單上,以及為什麼

  • llms.txt:Google 的指引說搜尋並不使用這類檔案
  • 為了贏得引用而不是為了富媒體結果而加的 schema
  • 封鎖訓練令牌,它改變的是模型學到什麼,而不是答案引用什麼
  • 全站萬用字元禁止,它會把你本來想要的搜尋爬蟲一起移除
  • 任何拿爬蟲命中量來賣、卻說不出樣本的手法

這些排除項不是口味問題。Google 的指引寫道,你「不需要為了出現在 Google 搜尋(包括其生成式 AI 能力)裡而建立新的機器可讀檔案、AI 文字檔、標記或 Markdown,因為 Google 搜尋本身並不使用它們」。2 這句話是第一方的、有日期的,這已經勝過被它排除掉的那些手法所能拿出的任何東西。結構化資料依然值得為富媒體結果而上,那裡的證據老而可靠;沒有任何東西撐著的,是被掛在它身上的那個引用主張。而且一份收進所有聽起來合理的項目的清單,也會毀掉自己的用途:十項會被跑完,二十五項只會被掃過,而真正要緊的那四項就落在被掃過的那一段裡。

節奏

這份清單該多久重跑一次?

只要有一次發布動到路由、渲染、回應標頭或邊緣設定,就把第一層重跑一遍;對多數團隊來說這意味著每週,而不是每季。第二層每月重跑,因為它的訊號是趨勢,一天的日誌只是噪聲。第三層是隨業務變動,而不是隨程式碼變動。

複查之前先等一天。OpenAI 的文件說,站點更新 robots.txt 之後「可能需要約 24 小時,我們的系統才會調整」3,Perplexity 的文件說改動「最多可能需要 24 小時」才被反映。5 修完一小時就重測、然後讀到舊行為,是團隊說服自己放棄一次正確改動的最常見方式。

把輸出存在能留住的地方,一次執行、一個 URL 一列,並帶上日期。第二次執行的價值在於它跟第一次的差異,而一份只活在終端機歷史裡的清單產生不了差異。除了通過與失敗,還有兩欄值得一直帶著:哪一項失敗了,以及兩次執行之間發布了什麼。這個配對是這套動作唯一能產出的因果證據;它很弱,而它是你真的收得到的那一種。

這份清單誠實的邊界

一份十項的清單會暗示這十項已經窮盡,而且全過本身就是一個結果。兩者都不成立。它窮盡的只是那些從站外和你自己的日誌就能便宜檢測出來的失敗;一個頁面可以十項全過,卻與引擎發出的任何一條查詢都不匹配,而那是這一頁看不見的覆蓋面問題。通過確立的是資格,不是引用,而這兩者之間隔著之後做出的每一次排名、選擇與合成決策。2026 年那篇批判性綜述把引用分數能預測點擊、轉換或營收這個說法評為非常低的置信度。9 請把一份跑完的清單讀成障礙已清除,永遠不要讀成結果:第一層建立在第一方廠商文件上,很強;而把其中任何一項連到錢上的證據,目前並不存在。

產品在哪裡派得上用場,在哪裡派不上

上面每一項都是免費的。第一層要的是 curl 和十分鐘,第二層要的是你本來就有的日誌權限,第三層要的是一個沒有軟體能替你做的決定。Bavior 一樣都不做:它不爬你的站,不讀你的 robots.txt,也沒辦法把一個被封鎖的頁面變得可抓取。它覆蓋的是這份清單之後的那一段,按排程把一組固定的 prompt 跑過各個引擎,並記錄每條答案引用了哪些來源,你就是這樣知道第一層的修復有沒有改變誰被引用。請先跑清單:去測量一個檢索不到的頁面,等於什麼都沒測。一條答案裡你能占到多少,在答案有多少是你的裡展開。

出處,全部核查於 2026 年 8 月 30 日
  1. Google Search Central,《AI features and your website》,最後更新於 2025 年 12 月 10 日(已收錄且可帶摘要展示的要求;第一方):developers.google.com/search/docs/appearance/ai-features
  2. Google Search Central,《Google’s Guide to Optimizing for Generative AI Features on Google Search》,2026 年 7 月 10 日(不需要新增 AI 文字檔;第一方):developers.google.com/search/docs/fundamentals/ai-optimization-guide
  3. OpenAI,爬蟲與機器人文件(OAI-SearchBot、GPTBot、ChatGPT-User;robots.txt 改動約需 24 小時被反映;第一方):developers.openai.com/api/docs/bots
  4. Anthropic,《Does Anthropic crawl data from the web?》(ClaudeBot、Claude-SearchBot;第一方):support.claude.com/en/articles/8896518
  5. Perplexity,機器人文件(PerplexityBot、Perplexity-User;使用者觸發的抓取;防火牆放行;第一方):docs.perplexity.ai/guides/bots
  6. Apple,《About Applebot》(Applebot、Applebot-Extended;第一方):support.apple.com/en-us/119829
  7. Zecchini、Moore、Ubl、Siddle,《The rise of the AI crawler》,Vercel,2024 年 12 月 17 日;各爬蟲的 404 與轉址占比(第一方日誌資料):vercel.com/blog/the-rise-of-the-ai-crawler
  8. Allaham & Diakopoulos,2026;被引用的 URL 有 27.1% 無法抓取,因為無法存取、已刪除或不是文字(預印本,見第 9 條綜述的轉述)
  9. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023 to 2026)》,arXiv:2607.14035;表 5 把引用分數能預測點擊或營收評為非常低的置信度:arxiv.org/abs/2607.14035
常見問題

你想知道的,都在這裡。

這份清單上最常見的失敗是哪一項?

第 03 項,具體說是 robots.txt 裡那條比團隊裡任何人都資深的、繼承下來的萬用字元全站禁止。它一次就把所有搜尋側爬蟲移除,它在日誌裡留下的痕跡跟真正的沒興趣一模一樣,而且只要你是從頭到尾讀這個檔案、而不是逐個令牌去求解,它就一直看不見。在花一整天鑽日誌之前,先查這一項。

如果第一層全過,日誌那部分能跳過嗎?

不能,因為第一層測的是意圖,日誌測的是執行。邊緣上的機器人管理規則會在你的應用或 robots.txt 被問到之前就擋掉請求,而它通常由另一個團隊維護。Perplexity 自己的文件就提醒站點所有者,Web 應用防火牆可能需要明確把它的機器人加進放行清單。這些第一層一個都看不見。

修好之後,多久才該看到變化?

行為上超過一天,結果上還要更久。OpenAI 的文件寫明 robots.txt 的改動約需 24 小時才被反映,Perplexity 寫的是最多 24 小時,所以當天下午的重測讀到的是舊狀態,看起來像失敗。接下來動的是抓取量,尺度是幾週。引用會不會跟著來,是另一個問題,這份清單並不回答。

十項全過,是不是就代表我會被引用?

不是。這份清單確立的是資格,也就是有沒有可能成為候選,僅此而已。選擇、排名與合成都發生在它之後,而一個頁面可以十項全過,卻與引擎實際發出的任何一條查詢都不匹配。請把全過讀成障礙已清除,然後回去做覆蓋面和內容的工作。

Bavior 編輯部

負責研究與維護 Bavior 關於 Reddit 行銷和 AI 搜尋可見度的所有內容。文中每一個數字都註明了來源出處與查證日期,所有外部連結均非聯盟推廣連結。

發現數字有誤?告訴我們,我們會重新查證:support@bavior.com

資格是地板,不是終點。
通過之後,去看看誰被引用了。

免費試用