首頁/學習 GEO/前 90 天
GEO 專案 · 營運

GEO 專案的前 90 天應該長什麼樣?

一份帶著「你真願意讓它失敗」的閘門的排期,順序由測量本身能支撐什麼決定。第一個月買的是儀器,不是結果。

本頁內容
分享本文
分享到 X 分享到 LinkedIn
簡短回答

第一個月幾乎只做一件事:把儀器架起來,因為儀器自己的晃動比你想偵測的那點變化還大。接著按「每個階段產出下一個階段所需輸入」的順序推進,並在階段之間放上你真願意讓它失敗的閘門。溫度為零時重複執行會改變 9 到 28% 的判定,四個引擎上逐日的來源級 Jaccard 落在 0.34 到 0.42 之間,所以一個季度勉強夠把這層雜訊刻畫出來,談不上蓋過它。1

關鍵要點
  • 承諾「第 90 天拿出可測量的提升」,等於承諾儀器給不了的東西。一個季度真正交付的是:一條基線、一層乾淨的技術底座、一份帶日期的變更日誌,以及一次誠實的複測。
  • 第 1 到 4 週是架儀器:prompt、執行次數、記錄下來的執行元資料、一個凍結的面板版本,以及一組誰都不去碰的對照組。
  • 四道閘門,每一道都寫明失敗時怎麼辦:技術通過、面板凍結、對照組不被觸碰,以及一次條件對齊的複測。
  • 內容工作要等到第 5 週,因為已發表的內容側效應量都很小、其中幾項還是負的;這麼小的效應必須待在儀器後面。
測量

為什麼第一個月買的是儀器而不是結果?

理由和專案管理慣例沒有關係,而是來自「你什麼都不動的時候,測量自己會怎麼動」。2026 年那篇批判性綜述把可複現性的證據集中到了一處。Kirsten 等人(其 4,706 條查詢的審計是同儕審查成果)發現,在溫度為零的條件下重複執行一次,會改變 9 到 28% 的判定。2 Schulte 等人在四個引擎上觀察 45 天(一個很小的瑞士查詢集合),記錄到逐日的來源級 Jaccard 落在 0.34 到 0.42 之間。1

把這兩條放在一起讀。在任意一天裡,引擎為你這套 prompt 引用的來源中,有很大一部分和昨天不一樣,而你這邊什麼都沒改。這就是任何干預必須蓋過的量級,也是為什麼基線是一個分布而不是一次讀數。跑一次單條 prompt,告訴你的關於引擎的資訊很少,關於「你執行它的那一分鐘」的資訊倒是不少。

要多少條 prompt、跑多少次才買得到一個可用的區間,算在面板規模裡;某個面板規模能偵測到什麼、偵測不到什麼,算在統計檢定力裡。這裡都不重複;本文只取它們的結論:報告單位是面板,單條 prompt 永遠不是。

這對日曆的後果,值得對訂下這個期限的人說清楚。90 天之內,你可以建立一條你信得過的基線、把修復上線,再把面板重讀一次。你沒辦法同時證明某一次內容改動導致了某一段變化,因為拿一次前後對比去對付一台會漂移的儀器,撐不起這個結論。第一週把這話說了,遠比第十二週再說好。

閘門

每個階段要過哪些閘門?

閘門是一個你真願意讓它失敗的條件。如果失敗了什麼也不會發生,那它就只是個里程碑,而里程碑保護不了任何東西。

閘門時點通過條件不通過怎麼辦
可檢索性第 4 週範圍內的頁面在一次普通抓取裡就回傳答案正文,已被收錄且可帶摘要展示,而且你依賴的爬蟲令牌 沒有一個被禁止停下。引擎抓不到的頁面,其餘一切也無從測量
面板凍結第 4 週prompt 清單、每個引擎的執行次數與記錄下來的執行元資料都已打上版本,且在第 12 週之前不會變重做基線。中途長大的面板,分母是跟著分子一起動的
對照組第 4 週有 10 到 15 條 prompt 被標記為永不干預,而且做事的人都知道是哪幾條可以繼續,但要把變化寫成與你的工作同時發生,而不是由你的工作導致
複測第 12 週第 12 週那次執行在產品、模式、模型、地區、帳號以及是否開啟搜尋上,都與第 4 週那次一致把差異寫成未測量。未測量不等於零

第一道閘門是技術通過。它的具體條目不歸本文管:技術檢查清單按跑起來最便宜的順序列出了那些條目。這裡要講的是它為什麼排在最前面。Google 的文件寫明,要有資格成為支持連結,頁面「必須已被收錄,並且有資格帶摘要出現在 Google 搜尋裡」7,而它的生成式功能「根植於我們核心的搜尋排序與品質系統」。6 一個過不了這一關的頁面,產出的不是一個弱測量,而是沒有測量;此後每一次把它算進去的比較,都是在把「不存在」讀成「結果」。

第四道閘門看起來吹毛求疵,直到它咬人。那篇綜述的可複現性建議列出了一次執行必須記錄哪些東西,另一次執行才和它可比:「產品、模式、模型、日期、地區、帳號,以及是否開啟搜尋」。1 在第 4 週和第 12 週之間改動其中任意一項,你報告出來的差異就悄悄把它也包了進去。第 1 週把它們寫下來不花什麼成本;到第 12 週再去還原,則根本做不到。

排期

每一段週次分別產出什麼?

順序的依據是:每個階段產出下一個階段所需的輸入。產出才是真正的規格,活動只是抵達那裡的方式。

01

第 1–2 週 · 架儀器

prompt 要從真實的通話、工單和輸單記錄裡寫出來,不要從關鍵字工具裡抄,然後按排程執行它們。產出:每個引擎一條帶區間的基線,以及這些引擎引用過的 URL。

02

第 2 週 · 健檢

技術檢查清單和基線並行跑,不要等基線跑完再跑。它是唯讀的,不會擾動底下正在進行的測量。產出:一份修復清單,其中大部分是一個衝刺的量。

03

第 3–4 週 · 修復並凍結

把技術修復上線,然後給面板打版本、指定對照組。產出:一個可檢索的站點,以及一台不會再因為你的動作而移動的儀器。

04

第 5–8 週 · 站內

把意圖最強的那批頁面改寫成段落式:問句標題、答案放在頭兩句、數字帶著分母。產出:這些頁面在選擇階段也有資格,而不是只在檢索階段有。

05

第 7–12 週 · 站外

更正第三方頁面上關於你的錯誤事實,讓實體描述保持一致,去回答引擎已經在引用的那些討論串。產出:被引用的 URL 組成發生變化,而且來得比誰都希望的要晚。

06

第 12 週 · 複測

重跑那個凍結的面板,把被干預的 prompt 與對照組並排放,然後無論結果朝哪個方向都把它寫下來。產出:一份站得住腳的前後對比,或者一個誠實的零結果。

內容排在第 5 週,除了基線還沒有之外還有第二個理由:已發表的內容側介入效應量都很小,其中幾項還是負的。C-SEO Bench 是 NeurIPS 2025 上一個涵蓋十種方法的基準,它報告說其中多數「不僅大體上無效,還常常對文件排名產生負面影響」,而且在 54 個案例中只有 3 個出現統計顯著的排名改善。4 KDD 2026 上的 SAGEO Arena 把檢索與重排重新放了回來,而不是直接給模型一段固定脈絡,它發現只優化正文會把三個標題級均值從 0.58、1.00、0.50 拉到 0.53、0.84、0.47,也就是分別朝反方向走了 9%、16% 和 6%。5 這麼小的效應必須待在儀器後面。

承諾

到第 90 天你能誠實承諾什麼?

四件交付物,沒有一件是「某個數字漲了」。一個打了版本的 prompt 面板,附每個引擎的基線與區間。一層能通過抓取級審計的技術底座。一份帶日期的變更日誌,好讓下個季度能做歸因而不是靠猜。以及一次把對照組並排放著的面板複測。這份清單能在一屋子懷疑的人面前站住,它也就是一個季度誠實買到的東西。

你不能承諾的,恰恰是你會被要求的那些:某個排名、出現在某條具體的答案裡,或者收入。那篇綜述的信心度表把「引用分數能預測點擊、轉換或收入」評為極低1 流量那一端也很弱:Pew 在 2025 年 3 月追蹤了 900 名美國成年人的 68,879 次 Google 搜尋,發現點擊 AI 摘要裡某個來源的情況「只發生在全部造訪的 1%」。8 一個被當成流量專案賣出去的能見度專案,最後會按它從來沒在測的指標被審判。

還有一條限制是算術而不是判斷。如果你的面板只能分辨大約十個點的變化,而你上線的改動值三個點,那麼第 12 週的複測就什麼也看不到;這是儀器的屬性,不是關於這份工作的證據。請在第 1 週就決定多大的變化會改變一個決策,拿它去對照統計檢定力;如果面板看不見這麼小的變化,要麼把面板做大,要麼別再承諾能偵測到它。

失效方式

哪些排序錯誤會葬送整個季度?

有一支把季度順序做反了的團隊,可以把這種失敗講具體。他們一上來就是六週的內容衝刺,因為內容是所有人都已經會做的那部分;第 7 週才開始測量;到第 12 週手裡有一條上揚的線,卻沒有辦法為它辯護。頁面在任何人記錄「引擎看到的是什麼」之前就已經改了,於是那個「之前」只存在於記憶裡。面板從 22 條 prompt 長到了 60 條,於是分母跟著分子一起動。而且沒有對照組,所以一次把所有東西都抬起來的平台側變化,看上去和「衝刺奏效了」一模一樣。他們做的每一件事本身都不壞。是順序把它作廢了。

經得起複盤的排序

  • 在範圍內任何頁面被改動之前,先取基線
  • 一個季度只有一個面板版本,並寫進報告裡
  • 一組 10 到 15 條、誰都不碰的對照 prompt
  • 一個時間窗只動一個變數:技術、站內、站外
  • 按引擎分別給數,每個數都帶自己的區間

會讓結果作廢的排序

  • 第 1 到 4 週搞內容衝刺
  • 想到什麼問題就往面板裡加 prompt
  • 技術修復和內容改動在同一週上線
  • 把各引擎平均成一個混合分數
  • 把單次執行讀成事實

「混合分數」這一條能上榜,靠的是測量而不是口味。SIGIR 2026 上一項涵蓋 11,500 條代表性查詢的研究測得,Google 自然結果、AI Overviews 與 Gemini 之間 URL 層級的 Jaccard 相似度為 0.11 到 0.18。3 Jaccard 是交集除以聯集,不是被引用 URL 的佔比;在這個水準上,這三個面幾乎不相交。把它們平均出來的那個數,描述的不是任何人真能去造訪的引擎。

交接

第 91 天會發生什麼?

計畫結束,節奏開始,這兩者形狀不同。這 90 天存在的意義,是造出一樣此後可以用一小部分注意力長期跑下去的東西:一個按排程執行的面板、一份每個月欄位都相同的報告,以及一個永遠清不完的站外佇列。週期性的節奏歸每週工作流管,報告的形狀與它的對照組比較歸可辯護的報告管,長期帳單歸營運成本管。本文在交接處停下。

有一樣東西確實會越過這條邊界。閘門並不在第 90 天退休,它們變成之後每一次比較的常設條件。一個重做基線、擴大面板,或者弄丟了對照組的季度,無論日曆怎麼寫,都是從這份計畫的第一週重新開始。

本文的誠實邊界

這裡的排序論證依據的是關於不穩定性的證據,而不是「這個順序優於另一個順序」的證據。沒人做過那個實驗,也很難看出怎麼做:對照條件需要同一個站點的第二份拷貝。兩個不穩定性數字都來自很窄的樣本,一個是 45 天的小型瑞士查詢集合,一個是 4,706 條查詢的審計,而且都是經由一篇綜述轉述,而不是被獨立複現過。它們確立的是:測量自己就會顯著移動,這一點排除了「在一個季度內承諾可測量的提升」。但它們不足以確立這些週次邊界是最優的。請把它們當作一個站得住腳的預設值,等你自己的基線說了別的,再去挪動它們。

產品在哪裡派得上用場,在哪裡派不上

這份計畫裡大部分是日曆紀律,而沒人賣這個。prompt 來自你自己的通話和工單,技術修復是你工程師的活,凍結和對照組則是必須有人做出、並且守住的決定。沒有任何工具能強制執行這些。工具能做的是中間那段重複勞動:Bavior 按排程把一組固定的 prompt 面板打到五個引擎上,記錄每條答案引用了哪些來源,並保留讓第 12 週與第 4 週可比所需的執行元資料;當被引用的來源是一條進行中的討論串時,它會用你掌控的帳號起草回覆,在任何內容發出之前由你審核。它不會替你寫面板,不會替你決定何時凍結,無法讓一個抓不到的頁面變得可檢索,也沒辦法把這 90 天縮短。免費 AI 能見度檢測免費 GEO 健檢不需要付費方案;付費方案為按月支付每月 $99 起,或按年支付每月 $79.17(截至 2026 年 8 月 30 日)。

出處,全部核查於 2026 年 8 月 30 日
  1. 《A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035;9–28% 的重複判定變化(Kirsten 等)、逐日來源級 Jaccard 0.34–0.42(Schulte 等,四個引擎、45 天、一個很小的瑞士查詢集合)、可複現性欄位與表 5(預印本):arxiv.org/abs/2607.14035
  2. Kirsten 等,《Characterizing Web Search in The Age of Generative AI》,Findings of ACL 2026;4,706 條查詢,美國與德國,2025 年 9 月:aclanthology.org/2026.findings-acl.526
  3. Grossman 等,SIGIR 2026;11,500 條代表性查詢;URL 層級的 Jaccard 為 0.11–0.18:arxiv.org/abs/2604.27790
  4. Puerto、Gubri、Green、Oh、Yun,《C-SEO Bench: Does Conversational SEO Work?》,NeurIPS 2025 Datasets & Benchmarks Track,arXiv:2506.11097:arxiv.org/abs/2506.11097
  5. 《SAGEO Arena》,KDD 2026,arXiv:2602.12187v2;表 2,僅優化正文的均值與基線對比:arxiv.org/abs/2602.12187
  6. Google Search Central,《Google’s Guide to Optimizing for Generative AI Features on Google Search》,最後更新於 2026 年 7 月 10 日(「根植於」那一句;第一方文件):developers.google.com/search/docs/fundamentals/ai-optimization-guide
  7. Google Search Central,《AI features and your website》,最後更新於 2025 年 12 月 10 日(已被收錄且可帶摘要展示;第一方文件):developers.google.com/search/docs/appearance/ai-features
  8. Pew Research Center,《Google users are less likely to click on links when an AI summary appears in the results》,2025 年 7 月 22 日;900 名美國成年人、68,879 次搜尋,2025 年 3 月:pewresearch.org
常見問題

你想知道的,都在這裡。

GEO 專案能在 90 天內證明可測量的提升嗎?

很少能,而承諾這件事的計畫是在高估儀器。溫度為零時重複執行會改變 9 到 28% 的判定,四個引擎上逐日的來源級 Jaccard 落在 0.34 到 0.42 之間,所以一個季度大致就只夠刻畫這種漂移、外加把面板讀一次。請改為承諾一份可信的基線、一層乾淨的技術底座,以及一次誠實的複測。

為什麼第一個月裡沒有內容工作?

因為頁面在基線取得之前就變了,會毀掉之後的每一次比較:那個「之前」從此只存在於記憶裡。還有第二個理由。已發表的內容側效應都很小,而且常常是負的,C-SEO Bench 在 54 個案例裡只有 3 個出現顯著的排名改善;這麼小的效應,在儀器還沒跑起來的時候根本讀不出來。

為什麼 prompt 面板必須凍結到第 12 週?

因為一個在季度中途長大的面板,分母是跟著分子一起動的,第 12 週那條序列於是和第 4 週的那條不可比。請在第 4 週結束時把 prompt 清單、每個引擎的執行次數和記錄下來的執行條件凍結並打上版本,把新問題放進下一個季度的面板,而不是這一個。

如果到第 90 天什麼都沒動,該怎麼報告?

就報告這個零結果,並把面板版本、觀測數和區間一併寫在旁邊,同時說明這個面板本來能偵測出多大的變化。一台只能分辨十個點的儀器給出一條平線,並不是三個點的變化失敗了的證據,而是面板看不見它的證據。這個區分,就是一份報告和一個故事之間的差別。

Bavior 編輯部

負責研究與維護 Bavior 關於 Reddit 行銷和 AI 搜尋可見度的所有內容。文中每一個數字都註明了來源出處與查證日期,所有外部連結均非聯盟推廣連結。

發現數字有誤?告訴我們,我們會重新查證:support@bavior.com

第一個月買的是儀器。
先把它架起來,再動手修。

免費試用