首頁/學習 GEO/引擎是否一致
AI 搜尋如何運作 · 專題

AI 引擎在「引用誰」上意見一致嗎?三項學術審計說:大體上不一致。

同一個問題問兩個助手,回來的來源大體不同;同一家公司在同一個索引上做出來的兩個介面,也是如此。這一個事實,決定了 AI 能見度必須怎麼測、怎麼報。

本頁內容
分享本文
分享到 X 分享到 LinkedIn
簡短回答

AI 引擎在「引用哪些來源」上大體並不一致,所以某個引擎上的一次引用,對其他任何引擎都只是很弱的證據。最刺眼的一項測量來自同一家公司在同一個索引上做出來的三個介面:SIGIR 2026 上發表的一項 11,500 條查詢研究報告,Google 自然結果、AI Overviews 與 Gemini 之間 URL 層級的平均 Jaccard 相似度低於 0.2。1

關鍵要點
  • Jaccard 是交集除以聯集,不是「你被引用的 URL 佔比」。在 0.18 這個水準上,兩個介面返回的來源合起來,只有 18% 是兩邊都返回的。
  • 分化在內容品質被評判之前就開始了:各引擎用不同的令牌抓取,把問題展開成不同的子查詢,引用的來源數量與類型也不同。
  • 單一的混合 AI 能見度分數,正好蓋掉唯一能拿來行動的資訊。請一個引擎一個介面一行地報,寫上日期與地區設定,行與行之間不做任何算術。
幾項測量

兩個 AI 引擎的重合度到底有多少?

兩個 AI 引擎的重合,遠比多數人以為的少:同一家公司在同一個索引上做出來的兩個介面,URL 層級的 Jaccard 也只有 0.11 到 0.18;而在唯一測過這件事的那項審計裡,兩個互不相干的助手只共享了 26% 的域名。

四項獨立的學術測量,方法、分母與採集時間窗各不相同。先讀最後兩欄,再讀數字。

研究樣本與採集時間窗結論它測的是什麼
Grossman 等,SIGIR 202611,500 條查詢URL Jaccard 0.11–0.18Google 自然結果、AI Overviews 與 Gemini 之間的集合重合
Kirsten 等,Findings of ACL 20264,706 條查詢,2025 年 9 月採集53% 不在自然結果前十;27% 不在前一百按 AI Overviews 查閱過的域名計,對照同一查詢的自然結果
Xu、Iqbal 與 Montgomery,2026 預印本55,393 條查詢,2026 年 3 月 13 日至 4 月 21 日採集29.8% 不在自然結果首頁上按 AI Overview 引述的域名計,對照同一查詢的首頁
Li 與 Sinnamon,2024672 條回答,355 個唯一域名26% 被兩者共同引用兩個助手之間的域名重合

2026 年那篇批判性綜述用一句值得原樣引用的話下了結論:這些結果“否定了存在全域 GEO 排名的觀念。能見度是按引擎與介面索引的。”4 根本不存在「你的 AI 搜尋位次」這樣一個對象。存在的是五、六個位次,彼此只有鬆散相關。兩個互不相干的助手之間,差距還要更大:2024 年那項對 Bing Chat 與 Perplexity 的審計發現,它看到的域名裡有 74% 只被其中一個引用過。3

怎麼讀這個數字

0.15 的 Jaccard 到底是什麼意思?

Jaccard 相似度是交集的大小除以聯集的大小,這和「你被引用的 URL 佔比」不是同一個量,卻經常被當成同一件事轉述。如果對同一條查詢,AI Overviews 引用了十個 URL、Gemini 也引用了十個,0.15 的重合度意味著大約三個 URL 同時出現在兩份清單上,而兩邊合起來約有十七個不同的 URL。Grossman 等對重合最高的那一對給出了自己的說法:“平均而言,AIO 或傳統 SERP 返回的來源中,只有 18% 會被兩個搜尋引擎同時檢索到。”1

這三對的糟糕程度並不相同,而摘要不會告訴你這件事。摘要只給出“平均 Jaccard 相似度 <0.2”;兩兩之間的值在表 2 裡:AI Overviews 對自然結果是 0.18,自然結果對 Gemini 是 0.16,AI Overviews 對 Gemini 是 0.11。1 大多數人當成可以互換的那一對,也就是兩個生成式介面,恰恰是最不一致的一對。

靠重複測量也救不回來。那篇批判性綜述轉述 Schulte 等的觀察:在四個引擎、45 天裡,逐日的來源層級 Jaccard 約為 0.34 到 0.42,24 小時內的重複測量也在相近水準;綜述正是據此主張每條 prompt 跑七到八次。11 請把限制條件連同數字一起讀:綜述寫明,這個結果來自一個很小的瑞士查詢集合。即便如此,已發表的最緊的一種比較,也沒有到一半。

機制

讀同一個網路的引擎,為什麼分歧這麼大?

引擎之所以不一致,是因為在「內容品質」被考慮之前,就已經有四件事不同:怎麼抓取、怎麼展開問題、引用多少來源、偏好哪一類來源。

這四種差異會疊加,而且沒有一種能一次為所有引擎修好。

01

它們讀到的不是同一個網路

每個引擎用自己的令牌抓取,各家廠商分別寫在文件裡:OpenAI 把 GPTBot 與 OAI-SearchBot 分開,Anthropic 把 ClaudeBot 與 Claude-SearchBot 分開,Google 把 Google-Extended 與 Googlebot 分開。5 一條 robots.txt 規則擋住其中一個,其餘不受影響,所以在排序開始之前,候選池就已經不同了。

02

它們展開問題的方式不同

Google 的文件寫明,AI Overviews 與 AI Mode 可能使用查詢扇出技術,跨子話題與資料來源發起多次相關搜尋來產生回答。6 子查詢由各引擎各自產生,所以在任何一方開始排序之前,兩個引擎檢索的其實是不同的問題。

03

它們的引用預算不同

在 602 條受控 prompt 上,每條回答的平均引用數是 ChatGPT 6.88、Google 的 AI 介面 12.06、Perplexity 16.35。7 引用 16 個來源的引擎,會比引用 7 個的引擎在候選清單上探得更深,所以邊緣位置上的那個來源天生就不一樣。

04

它們偏好的來源類型不同

在同一份資料集裡,論文標為「官方」的來源佔 ChatGPT 引用的 34.22%,佔 Google 的 46.35%;新聞類在 ChatGPT 是 31.17%,在 Google 是 18.99%。7 對某個引擎是「對的類型」的頁面,對另一個引擎可能就是「錯的類型」。

這四種差異是相乘而不是互相抵消,這就是觀測到的重合度如此之低的原因。它也解釋了多數團隊當成謎題的一種現象:一個頁面可以被某個引擎持續引用,卻在另一個引擎裡從不出現,而頁面本身沒有任何問題。在歸咎內容之前,先確認那個無視你的引擎到底抓不抓得到你。那是技術 GEO 的主題,和「把答案寫得更好」是兩件不同的調查。

分母問題

Google 排名還能預測「會不會被引用」嗎?

排名依然是「會不會被引用」最強的單一預測因子,而它本身已經不夠。你無法把這件事表達成某一個重合百分比,因為已發表的數字回答的是兩個不同的問題。“有多少比例的 AI 回答裡,至少含一個同時也有排名的頁面?”和“有多少比例的單條引用,來自同時也有排名的頁面?”在同一份資料上的答案天差地別。一項 2025 年 10 月涵蓋 362,000 條美國查詢的商業研究同時報出了這兩個數:94% 的 AI Overviews 至少含一個自然結果前二十的 URL,而單條引用中有 56% 來自前二十。8 同一份資料,兩個數字,都對,相差三十八個百分點。

學術數字一旦讀清分母,也落在同一個位置,而且它們合起來是一個帶著兩個日期的區間,不是一個點值。Kirsten 等的 4,706 條查詢審計採集於 2025 年 9 月的美國與德國,按查閱過的域名計:“平均有 53%(27%)被 AIO 查閱的域名,不在自然結果的前十(前一百)之內。”2 Xu、Iqbal 與 Montgomery 在 2026 年 3 月 13 日至 4 月 21 日採集了 55,393 條趨勢查詢,報告 AI Overview 引述的域名中有 29.8% 在對應的首頁上任何位置都不出現。10 請把它當作區間引用:大約 30% 到 53%,並寫明兩個時間窗;同時把動詞分清楚:Kirsten 測的是系統查閱過的域名,這和它引用的域名並不相同;而且兩者都沒有回答「一則 AI Overview 裡通常有沒有一個有排名的頁面」,通常是有的。

這些數字變動得很快:某個提供方發布過按引用計的重合率,2025 年 9 月是 54.5%,2026 年 2 月約為 17%,同一個工具、同樣九個行業,對這個落差沒有給出任何解釋。9 任何超過大約六個月的重合數字都按過期處理,沒有日期的則按虛構處理。

本文誠實的邊界

這裡的每一個重合數字,都是一個移動中系統的快照,而且沒有任何一項學術研究涵蓋創業者關心的全部引擎。SIGIR 那項比較的是 Google 的三個介面,ACL 那項只做 Google,雙助手那項測的是 2024 年時的 Bing Chat 與 Perplexity。沒有人用同一套方法、在同一個時間窗裡測量過 ChatGPT、Perplexity、Google、Copilot 與 Claude,所以「引擎之間分歧很大」這個一般性結論有充分支撐,而任何具體的兩兩數字都不能搬到你的 prompt 集合上。請測你自己的集合,不要照搬這些數字。

報告方式

為什麼單一的混合 AI 能見度分數沒有意義?

跨引擎取平均,正好毀掉決策需要的那部分資訊,因為兩條只有鬆散相關的序列,其平均值並不構成對任何一條的摘要。一個在某引擎 40% 的執行裡被引用、在另一個引擎是 0% 的品牌,和一個在兩邊都是 20% 的品牌,混合分數完全相同,而這兩種處境要做的事恰好相反。前者是某一個引擎上的存取問題,後者是「到處都弱但到處都在」的位置。

加權只會讓情況更糟,而不是更好,因為跨引擎時「一次引用」並不是同一個單位。在那份 602 條 prompt 的資料集裡,每個被引頁面的平均影響力,ChatGPT 是 0.2713,Google 是 0.0584,Perplexity 是 0.0646,也就是一次引用能塑造多少答案,差了大約四倍。7 把一次 ChatGPT 引用加上一次 Perplexity 引用,等於把兩個不同的單位相加,任何單一純量都修不好這一點。

混合數字只有一個很窄的用途:以季度為粒度的粗略趨勢線,此時你只在意整體畫面有沒有在動。它撐不起排優先順序、競品比較,也判斷不了某個具體改動有沒有奏效,而多數人拿它去做的恰恰是這幾件事。

方法

那該怎麼報告 AI 能見度?

一個引擎一個介面一行,行與行之間不做任何算術。一張試算表就能跑。

把引擎和介面寫進每一個數字裡

不是“AI 能見度 18%”,而是“Google AI Mode,en-US,2026 年 8 月,40 次執行中被引用 7 次”。AI Overviews 與 AI Mode 是不同的介面,必須分成不同的行,因為同一家公司自己的幾個介面之間,重合度也只有 Jaccard 0.11–0.18。

記錄被引用的 URL,而不只是「你在不在」

每個引擎反覆引用的那組來源,就是你在那裡的競爭對手地圖,而且各引擎不同。在多數商業問題上,那份清單的大部分屬於別人。

預期修復會落得不平均,並且提前說明

一個在某引擎上提高了引用率的改動,可能在另一個引擎上好幾個月毫無動靜,甚至永遠沒有。在出貨之前就定好按引擎的目標,可以避免這被讀成失敗。

挑你的買家在用的那一兩個引擎

分化意味著平均覆蓋五個引擎,要為同樣的確信程度付出五倍成本。把兩個引擎測扎實,勝過把五個都測得潦草;而選哪兩個,應該跟著你的流量已經來自哪裡走。

上面這套報告紀律就是全部方法,而且不需要任何軟體。AI 搜尋如何運作這個階段提供了解釋這種分化的管線階段;測量 AI 能見度這個階段把按引擎分行的表變成完整的測量計畫;姊妹篇AI 答案為何變化講的是每一行內部的執行間變異。

產品派得上用場的地方,和派不上的地方

上面那張按引擎分行的表,你完全可以手工跑:固定的 prompt、每個引擎一個分頁、統計執行次數與被引用的 URL、不做平均。Bavior 自動化的就是這件雜活:它按排程把一組固定的 prompt 跑遍五個引擎,記錄每條答案引用了哪些來源,按引擎分別記而不是混合。它不產出單一的能見度分數,無法告訴你兩個引擎為什麼對你的判斷不同,也左右不了你的買家在用哪個引擎。免費 AI 能見度檢測免費 GEO 健檢不需要付費方案;付費追蹤為按月付費每月 $99 起,或按年付費每月 $79.17(截至 2026 年 8 月 29 日)。

出處,全部核查於 2026 年 8 月 30 日
  1. Grossman 等,“How Generative AI Disrupts Search”,SIGIR 2026,11,500 條查詢;摘要為“平均 Jaccard 相似度 <0.2”,表 2 給出兩兩的 0.18、0.16 與 0.11:arxiv.org/abs/2604.27790
  2. Kirsten 等,Findings of ACL 2026,對 Google AI Overviews 的 4,706 條查詢審計,資料採集於 2025 年 9 月的美國與德國;“on average 53% (27%) of domains that AIO consults are not contained in top-10 (top-100) Organic search results”:aclanthology.org/2026.findings-acl.526
  3. Li 與 Sinnamon,“Generative AI Search Engines as Arbiters of Public Knowledge”,Proceedings of ASIST 61(1),2024;跨 Bing Chat 與 Perplexity 的 672 條回答,355 個唯一域名,26% 被兩者共同引用:arxiv.org/abs/2405.14034
  4. “Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)”,2026 年 7 月 15 日,arXiv:2607.14035(綜述預印本):arxiv.org/abs/2607.14035
  5. 關於訓練令牌與搜尋令牌拆分的第一方爬蟲文件:OpenAI developers.openai.com/api/docs/bots,Anthropic support.claude.com/en/articles/8896518,Perplexity docs.perplexity.ai/guides/bots
  6. Google Search Central,“AI features and your website”(查詢扇出,第一方文件,最後更新於 2025 年 12 月 10 日):developers.google.com/search/docs/appearance/ai-features
  7. Zhang、He、Yao,“From Citation Selection to Citation Absorption: A Measurement Framework for GEO Across AI Search Platforms”,2026 年 4 月 28 日,arXiv:2604.25707(預印本,602 條 prompt 的開放資料集):arxiv.org/abs/2604.25707
  8. 2025 年 10 月一項 362,000 條美國桌機查詢的研究,同時報出 94% 的 AI Overviews 含一個自然結果前二十的 URL,以及單條引用中 56% 來自前二十。廠商發布;按本課程的出處規則,只描述、不連結。
  9. 按引用計的自然結果重合率 54.5%(2025 年 9 月)與約 17%(2026 年 2 月),出自同一個提供方的同一個工具、同樣九個行業,兩者未作調和。廠商發布;按本課程的出處規則,只描述、不連結。
  10. Xu、Iqbal 與 Montgomery,2026,55,393 條趨勢查詢,採集於 2026 年 3 月 13 日至 4 月 21 日;“29.8% of AIO reference domains do not appear anywhere on the corresponding first page”(預印本):arxiv.org/abs/2605.14021
  11. Schulte 等,2026,在四個引擎、45 天裡,逐日的來源層級 Jaccard 約為 0.34 到 0.42,樣本為一個很小的瑞士查詢集合;依出處 4 的批判性綜述轉述引用。
常見問題

你想知道的,都在這裡。

如果 ChatGPT 引用了我,Perplexity 也會引用我嗎?

按現有證據看,通常不會。一項涵蓋 Bing Chat 與 Perplexity 共 672 條回答的審計,找到 355 個唯一的被引域名,其中只有 26% 兩邊都出現。即使是同一家公司在同一個索引上做出來的兩個介面,URL 層級的 Jaccard 也只有 0.11 到 0.18,這來自 SIGIR 2026 上發表的一項 11,500 條查詢研究。請把某個引擎上的一次引用,只當作關於那個引擎的證據,其他引擎要分開檢查,不要假設它們會跟進。

AI 引用和自然結果前十的真實重合率是多少?

不存在唯一正確的數字,因為已發表的數字回答的是兩個不同的問題。按每條 AI 回答計算,也就是問這條回答裡是否至少有一個同時也有排名的頁面,一項 362,000 條查詢的商業研究發現 94% 的 AI Overviews 含有一個前二十的 URL。按每次引用計算,也就是問被引用的頁面中有多少比例同時也有排名,同一份樣本給出前二十佔 56%;而一項 4,706 條查詢的學術審計在 2025 年 9 月的資料上發現,AI Overviews 查閱的域名中有 53% 不在自然結果前十之內。2026 年 3 月與 4 月採集的一項 55,393 條查詢預印本,在可比的首頁口徑上測到 29.8%,所以要引用區間而不是點值。轉述任何一個數字之前,先問它用的是哪個分母、哪個採集時間窗。

我該只針對一個 AI 引擎優化,還是全都做?

挑你的買家真正在用的那一兩個,因為分化會讓廣泛覆蓋變得昂貴而不是周全。要把五個引擎覆蓋到同樣的確信程度,採樣成本大約是五倍;而在一個介面上奏效的修復,在另一個介面上經常毫無作用:同一家公司自己的自然結果、AI Overviews 與 Gemini 三個介面之間,Jaccard 只有 0.11 到 0.18。唯一的例外是技術上的可檢索性,那是同時對每個引擎都有回報的一層,因為可被索引、夠快、伺服器端渲染在哪裡都有幫助。

單一的混合 AI 能見度分數有沒有用?

只有作為季度之間的粗略趨勢線時有一點用,做決策時絕不可用。一個在某引擎 40% 的執行裡被引用、在另一個引擎是 0% 的品牌,和一個在兩邊都是 20% 的品牌,混合出來的數字完全相同,而這兩種處境需要的工作恰好相反。加權也救不了它:在一份 602 條 prompt 的學術資料集裡,每個被引頁面的平均影響力,ChatGPT 是 0.2713,Google 是 0.0584,Perplexity 是 0.0646,可見不同引擎上的引用並不是同一個單位。

為什麼引擎在 Google 上引用我,在 ChatGPT 裡卻從來不引用?

最常見的原因是:在做任何排序之前,這兩個引擎讀到的就不是同一個版本的網路。每家廠商都在文件裡分開了各自的爬蟲令牌,OpenAI 把 GPTBot 與 OAI-SearchBot 分開,Anthropic 把 ClaudeBot 與 Claude-SearchBot 分開,Google 把 Google-Extended 與 Googlebot 分開,所以一條 robots.txt 規則、一條 WAF 規則或一項渲染要求,可能把你從某個引擎的候選池裡剔除,而另一個引擎毫髮無損。在重寫頁面之前,先按引擎逐個檢查可抓取性。

Bavior 編輯部

負責研究與維護 Bavior 關於 Reddit 行銷和 AI 搜尋可見度的所有內容。文中每一個數字都註明了來源出處與查證日期,所有外部連結均非聯盟推廣連結。

發現數字有誤?告訴我們,我們會重新查證:support@bavior.com

不存在唯一的 AI 位次。
改成一個引擎一行地報。

免費試用