首頁/學習 GEO/第 4 階段
AI 搜尋如何運作 · 第 4 階段

選擇與重排是怎麼決定一則 AI 答案要用哪些段落的?

這個階段悄悄殺掉了大部分的內容工作,因為被評判的並不是你發布的那個頁面,而是重排器能從裡面抬走的、大約一百詞的一個區塊。

本頁內容
分享本文
分享到 X 分享到 LinkedIn
簡短回答

選擇與重排,是 AI 引擎把每一條扇出子查詢返回的候選集合併起來、去掉重複、按「每個段落對那條具體問題回答得多好」重新排序,並把名單一路裁到塞得進模型上下文預算為止的那個階段。被打分的單位是段落而不是頁面,所以一個很好的頁面,如果答案落在第九段,它在這裡是以一個平庸段落的身分參賽。在 2026 年 7 月發布、涵蓋 15,699,298 條 Google AI Mode 引用的廠商資料集裡,有 47.7% 解析成指向某一個具體段落的捲動定位高亮,而不是普通的頁面連結,被高亮段落的中位長度是 117 詞。1

關鍵要點
  • 四個操作依序執行:合併候選集、折疊近似重複、按「每個段落對子問題回答得多好」重排,然後裁到上下文預算。只有熬過這一刀的東西,才會抵達書寫階段。
  • 這裡被打分的不是網域權威度,所以弱站點上寫得清楚的答案,可以贏過強站點上被埋起來的答案。權威度早在檢索階段就已經起完作用了。
  • 段落在模型上下文裡的位置,是有文獻記載的槓桿裡最強的一個,而你無法直接設定它:在 NeurIPS 2025 一項以 GPT-4o-mini 進行的基準測試中,改善來源的上下文位置在零售領域帶來 2.77 個名次的移動,而最好的內容改寫只有 0.36。5
  • 所有有文件依據的控制手段都是做減法的。Google 點名了 nosnippetdata-nosnippetmax-snippetnoindex;沒有任何引擎讓你提名一個偏好段落。6
定義

選擇與重排階段發生了什麼?

選擇與重排把好幾份候選名單,變成一份簡短、有序、塞得進固定上下文預算的證據清單。四個操作依序發生。每一條扇出子查詢返回的候選集會被合併;近似重複與轉載副本會被折疊掉,免得同一個論斷佔走三個名額;剩下的由一個模型重新排序,它評的是每個段落對那條具體問題回答得多好,而不是它的網域有多權威;然後從尾端裁掉,直到證據裝得下。Google 用第一方的語言描述了同一個形狀:接地「依靠我們核心的搜尋排名系統」來檢索頁面,之後「我們的系統再審視那些被檢索頁面中的具體資訊,以產生更可靠、更有幫助的回答」。9 那個審視,就是第四階段。

讀這些段落的是一個模型,而不是一條作用在連結圖上的公式,這一點並不是對封閉系統的猜測。它就是已發表的技術:EMNLP 2023 的一項研究發現,被適當指令化的語言模型作為重排代理時,「能在常用的資訊檢索基準上,交出與最先進的監督式方法相當、甚至更好的結果」。10 重排器是一個讀者,而它讀的是區塊。

被低估的是「裁掉」這一刀。上游產出的候選有幾百上千條;抵達書寫階段的只有屈指可數的幾條。在 2026 年 4 月發表的一份 602 條 prompt 的學術樣本裡,一則成品答案上的引用數平均為 ChatGPT 6.88 條、Google 的 AI 介面 12.06 條、Perplexity 16.35 條。3 候選池的絕大部分都在這裡被丟掉了,而被丟掉的東西,無法靠下游更好的文筆撿回來。AI 搜尋如何運作 把這個階段放進了完整的管線裡看。

競爭單位

為什麼單位是段落,而不是頁面?

單位之所以是段落,是因為 Google AI Mode 的引用裡有 47.7% 指向的是一段被高亮的具體文字,而不是整個頁面;而被高亮文字的中位長度是 117 詞。

資料來自一份為期一年的廠商資料集:15,699,298 條 Google AI Mode 引用,橫跨 148 個產業,2026 年 7 月發布。1

47.7%的引用是段落高亮而不是普通頁面連結
117詞,被高亮段落的中位長度大約是一個緊湊的段落
85%的段落可以獨立成立不看周圍頁面也讀得懂
48%的「被反覆引用段落」以問句開頭一次性段落只有 22%

當引擎引用一個捲動定位高亮時,它是在 URL 本身告訴你它選中了哪些字,而這是目前存在最接近「公開窺見第四階段」的東西。同一份資料集還發現:80% 被抽走的段落把答案放在第一句;80.9% 的段落只被引用過一次,而大約 2,300 個段落被重複使用了 61 次以上;被回收最多的那一個段落被引用了 661 次。1 真正在競爭的不是頁面,是一個段落,而一個好段落可以被反覆使用幾百次。

有兩條但書跟著這些數字。它們是描述性的,不是因果性的。還有一個這份研究沒有解決的基準率問題:它報告了被抽走的段落裡有多少比例是答案前置的,卻沒有報告全網所有段落裡有多少比例是這樣,所以「80% 被抽走的段落是答案前置」並不能證明答案前置導致被抽走。請把它當成對一個說得通的機制的佐證,而不是一個被測出來的增幅。

稀釋

被埋起來的答案為什麼會輸?

被埋起來的答案會輸,是因為重排器評的是那個區塊,而圍在你答案四周的那八段並不是它的證據,它們是它周圍的雜訊。一個 3,000 詞的頁面,如果答案坐在第九段,它呈現出來的就是一個相關段落嵌在一大堆講相鄰主題的材料裡。而一個比較短的頁面,如果第二句就把問題答完,它呈現的是一個幾乎整段都打在靶心上的段落。頁面層級的權威救不了前者,因為這裡被打分的根本不是權威。

段落在頁面裡的位置看起來也有影響,儘管證據是廠商發布、而且作者自己聲明為相關性質的。2026 年 6 月一項針對 10,000 則 AI Overview 回答、100,000 個引用落點、透過捲動定位片段比對回原文位置的研究發現,38% 的引用取自頁面的前 100 詞,而一年前一個較小的對照集是 20%;作者明白寫道,這份資料是相關性質的,他們「能顯示 AI 模型從哪裡引用,但無法確定地說明為什麼」。2 實用的讀法不是「把所有東西都堆到最上面」,而是:開場白、品牌清嗓子和「本文將涵蓋……」佔走了整頁最值錢的地段。

一個段落被選中之後,它在模型上下文裡的位置同樣有影響,而且這方面的支持比任何關於頁面形態的說法都更強。2026 年那篇批判性綜述把上下文中的位置評為,前提是該文件已經被檢索到;把查詢與文件的相關性評為在受控設定下強4 NeurIPS 2025 的 C-SEO Bench 給出了數字:在 GPT-4o-mini 的零售領域裡,最好的傳統干預,也就是改善來源在 LLM 上下文裡的位置,讓目標平均前移 2.77 個名次,而它測試的十種內容改寫方法中最強的一種只有 0.36。論文自己的措辭沒有給出任何倍數:把目標文件「放在 LLM 上下文視窗的第一位,帶來的引用排名增益遠大於任何一種 C-SEO 方法」。5 為什麼會這樣,有它自己的文獻:模型表現「往往在相關資訊出現在輸入上下文的開頭或結尾時最高,而當模型必須存取長上下文中間的相關資訊時會顯著下降」。8 這個位置不是你設定的。你能施加的影響,是成為那個最精確回答了子問題的段落。

訊號

是什麼決定哪一個段落勝出?

決定的是與查詢的相關性,它的分量超過任何一個被測量過的格式特徵:由模型判定的相關性與引用影響力的跨平台相關係數是 r = 0.4322,高於同一份資料集裡的每一個結構性訊號。

以下是 602 條受控 prompt、21,143 條搜尋層引用、18,151 個被抓取頁面的描述性關聯,2026 年 4 月發表。比較的是平均引用影響力的最高與最低四分位。3

頁面特徵與引用影響力的關聯該怎麼讀
模型判定的查詢相關性跨平台最強訊號,r = 0.4322回答那個實際的問題,不是那個主題
答案與被引內容的嵌入相似度r = 0.3561用答案會用的字把它說出來
含有數字或統計0.1171 對 0.0725,即 +61.6%只用真實、標註日期、有出處的數字
含有定義標記0.1252 對 0.0795,即 +57.3%把「X 是……」寫成一句平實的話
標題數量最高四分位 10.59 個,最低四分位 0.85 個存在混淆;好頁面本來標題就多
列表密度最高四分位是最低四分位的 8.94 倍同樣的混淆;為讀者而做
問答式頁面格式0.0947 對 0.1005,即 −5.7%略微為負;可能混入了單薄的 FAQ 頁

作者自己的但書規定了這些結論能被推到多遠:他們無法分離標題是否導致被吸收,因為做得好的頁面既會被引用,也剛好帶著更多標題;而問答格式的負向結果,也可能與單薄的 FAQ 頁混淆在一起。3 在同一份資料集裡,訊號還會因引擎而異:Google 最強的是嵌入相似度加上定義標記,Perplexity 最強的是相關性加上標題數量與長度。對這一整族發現,批判性綜述給的指示才是該隨身帶走的那一條,而它把文件結構只評為中等且不一致:「結構應該逐階段評估,而不是被當成萬用護身符。」4

直接控制

你能控制引擎要用哪一段嗎?

只能反向控制,而且只在有文件說明控制手段的介面上。Google 的指引點名了四個:「若要限制你的頁面在搜尋中顯示的資訊,請使用 nosnippetdata-nosnippetmax-snippetnoindex 控制項」,而它的 AI 功能跑在同一套摘要資格上。6 這給了你一個方法,把某一塊文字排除在被引用之外,或替一個頁面能被顯示的量設上限,兩者都是在減少你的曝光面,而不是在導引它。

沒有正向的對應物。沒有任何引擎提供把某一段標記成「我希望被引用的是這一段」的方式,也沒有任何標記、檔案或指令能提名一個。唯一可用的正向影響是構成上的:讓回答子問題的那一段,成為整頁最清楚、最精準打在靶心上的東西,並給它一個把問題說出來的標題。這不是技巧,而這正是它一直有效的原因。

長度

在這個階段,更長的頁面會贏嗎?

長度和引用位置幾乎無關,而兩份碰到這個問題的大型資料集之所以結論不一致,是因為它們測的是不同的結果。2025 年 12 月一項涵蓋 560,346 則 AI Overviews、1,677,876 個被引用 URL、174,048 個可擷取內文頁面的廠商研究,測得字數與引用位置的 Spearman 相關性為 0.04;53.4% 的引用落在 1,000 詞以下的頁面上。7 2026 年 4 月那份學術資料集測的是平均影響力而不是位置,發現影響力隨長度上升,一路延伸到 3,000 詞以上。3

不同的結果變數、不同的樣本,沒有可用的調和方式。站得住腳的立場是:作為槓桿,長度是中性的;值得優化的,是這個頁面真正回答了多少個不同的子問題,以及每個答案在自己的段落裡坐得多乾淨。為了湊到某個字數而加字,是這件事裡肯定錯的那個版本。

本文誠實的邊界

沒有任何引擎公開過它如何切分頁面,所以「AI 系統把內容切成 200 到 400 個 token 的段落」這個被廣為轉述的說法,是對封閉檢索堆疊內部的斷言,不是事實:當心智模型有用,當規格說明一文不值,而任何人告訴你你自己頁面的 token 數,都是在猜。這裡的段落統計來自一份沒有基準率的描述性廠商資料集;特徵關聯來自一篇預印本,作者把驗證性分析留給後續研究,並聲明無法分離因果與相關。第四階段是檢索之後被測量得最好的階段,而它依然完全是從外面量的。

產品派得上用場的地方,和派不上的地方

第四階段你可以直接讀,免費,不需要任何軟體:在 Google AI Mode 上跑你的買家問題,點開引用,看每一個被引用頁面上的捲動定位高亮落在哪裡。這個習慣教給你的段落選擇知識,比任何指南都多,包括這一篇。Bavior 做的是重複的那一半:它按排程把一組固定的 prompt 打到五個引擎上,並記錄每一則答案引用了哪些來源,讓你能在幾十次執行而不是一次執行的尺度上,看出一次改寫有沒有改變什麼;而當被引用的來源是一串正在進行的討論串時,它會用你掌控的帳號草擬一則回覆,任何內容送出之前都要先由你審核。它不會改寫你的頁面,不會替你的段落打分,也無法讓重排器偏愛你。免費 AI 能見度檢測免費 GEO 健檢不需要付費方案;付費方案為按月付費每月 $99 起,或按年付費每月 $79.17(截至 2026 年 8 月 29 日)。

出處,全部核查於 2026 年 8 月 29 日
  1. 段落擷取資料集,2026 年 7 月發布:15,699,298 條 Google AI Mode 引用,橫跨 270 萬個頁面;47.7% 為捲動定位高亮,中位數 117 詞,約 85% 可獨立成立,80% 答案前置,被反覆引用的段落有 48% 以問句開頭,一次性段落為 22%。廠商發布,只描述不附連結。
  2. 引用落點研究,2026 年 6 月發布:10,000 則 AI Overview 回答、100,000 個透過捲動定位片段比對的落點;38% 的引用來自前 100 詞,2025 年對照集為 20%;作者聲明該資料為相關性質。廠商描述。
  3. Zhang、He、Yao,〈From Citation Selection to Citation Absorption〉,2026 年 4 月 28 日,arXiv:2604.25707(預印本,開放資料集)。arxiv.org/abs/2604.25707
  4. Martinez,〈Optimizing Visibility in Generative Engines: A Critical Survey of GEO (2023–2026)〉,2026 年 7 月 15 日,arXiv:2607.14035(綜述預印本;表 4 為各槓桿評級)。arxiv.org/abs/2607.14035
  5. Puerto、Gubri、Green、Oh、Yun,〈C-SEO Bench: Does Conversational SEO Work?〉,NeurIPS 2025 Datasets & Benchmarks Track,arXiv:2506.11097。arxiv.org/abs/2506.11097
  6. Google Search Central,〈AI features and your website〉(摘要控制項;第一方,更新於 2025 年 12 月 10 日)。developers.google.com/search/docs/appearance/ai-features
  7. 內容長度研究,2025 年 12 月發布:560,346 則 AI Overviews、1,677,876 個被引用 URL、174,048 個可擷取內文的頁面;字數對引用位置,Spearman 0.04。廠商描述。
  8. Liu 等人,〈Lost in the Middle: How Language Models Use Long Contexts〉,TACL 2024,arXiv:2307.03172。arxiv.org/abs/2307.03172
  9. Google Search Central,〈Optimizing your website for generative AI features on Google Search〉(第一方,更新於 2026 年 7 月 10 日)。developers.google.com/search/docs/fundamentals/ai-optimization-guide
  10. Sun 等人,〈Is ChatGPT Good at Search? Investigating LLMs as Re-Ranking Agents〉,EMNLP 2023,arXiv:2304.09542。arxiv.org/abs/2304.09542
常見問題

你想知道的,都在這裡。

一個段落要多長才會被 AI 搜尋引用?

在 2026 年 7 月一份涵蓋 1,570 萬條 Google AI Mode 引用的廠商資料集裡,被高亮段落的中位長度是 117 詞,大約就是一個緊湊的段落,而其中約 85% 不看周圍頁面也讀得懂。這是對什麼會被擷取的描述,不是一個要去湊的目標,而且沒有任何引擎公開過自己的切塊尺寸。這個發現有用的版本是結構性的,不是數值性的:把每個答案寫成在一個段落之內就完整,因為引擎抬走的東西就是這個形狀。

我可以告訴 AI 引擎要引用哪一段嗎?

正向地不行:沒有任何引擎提供提名偏好段落的方式,也沒有任何標記、檔案或指令做得到。現有的控制手段全是做減法的:Google 的文件把 nosnippet、data-nosnippet、max-snippet 與 noindex 列為「限制你的頁面在搜尋中顯示資訊」的方式,而它的 AI 功能跑在同一套摘要資格上。所以你可以把某一塊排除在被引用之外,或替頁面能被顯示的量設上限,但唯一可用的正向影響,是把回答那個問題的段落,做成整頁最清楚、最能獨立成立的那一段。

是頁面權威度決定哪一段被選中嗎?

在這個階段不是:重排評的是一個段落對那條具體子問題回答得多好,所以弱頁面上寫得清楚的答案,可以贏過強頁面上被埋起來的答案。權威度在更早的檢索階段才重要,那裡的排名決定這個頁面到底能不能成為候選。這個區分有實際後果:如果一個站點比較弱的競爭對手一直被引用,問題通常不在他們的網域強度,而在他們那一段的形狀,而你點開那條引用、看看哪些字被高亮,一分鐘就能確認。

標題和列表會讓頁面更容易被引用嗎?

關聯是真的,因果沒有被證明。在 2026 年 4 月發表的一份 602 條 prompt 的學術資料集裡,引用影響力最高四分位的頁面標題數中位為 10.59,最低四分位為 0.85,而列表密度是 8.94 倍,但作者直接寫明,他們無法分離標題是否導致被吸收,因為做得好的頁面既會被引用,也剛好帶著更多標題。2026 年那篇批判性綜述把文件結構評為「中等且不一致」,並建議在不預設效應方向的前提下測試。做它是因為它讓頁面好用;別為它承諾任何東西。

Bavior 編輯部

負責研究與維護 Bavior 關於 Reddit 行銷和 AI 搜尋可見度的所有內容。文中每一個數字都註明了來源出處與查證日期,所有外部連結均非聯盟推廣連結。

發現數字有誤?告訴我們,我們會重新查證:support@bavior.com

真正在競爭的不是頁面。
是那一個段落。

免費試用