首頁/學習 GEO/六種能見度
測量 AI 能見度 · 定義

人們口中的「AI 能見度」,到底是哪六樣東西?

六個彼此獨立的測量共用一個名字,它們各自變動,而大多數報告只顯示其中兩個。提及與引用之間的落差,才是會改變你週一做什麼的那一個。

本頁內容
分享本文
分享到 X 分享到 LinkedIn
簡短回答

AI 能見度是六種不同的測量頂著同一個標籤:提及率、引用率、聲量佔比、答案內位置、表述準確度、來源歸屬。它們各自變動,所以一個混成單一數字的能見度總分,恰好把你唯一能據以行動的東西平均掉了。它們會分開,是量得出來的,不是理論:一項針對生成式搜尋引擎的評測發現,生成句子中平均只有 51.5% 被其所掛的引用完全支撐,7 可見「被引用」和「被正確描述」顯然不是同一個量。

關鍵要點
  • 這六個不是同一個數字的六種變體。提及率和引用率是佔答案的比例,聲量佔比是品牌之間的比值,位置是序數,表述準確度是人工判定,而來源歸屬是一份 URL 清單,不是一個分數。
  • 提及對引用,是那道會改變你做什麼的落差。有連結卻正文不點名,是你自己頁面上的造句問題;被點名卻沒有連結,來自訓練資料,站內工作在一個發布週期內動不了它。
  • 來源歸屬是六者中唯一能指出行動的,因為它記錄一則答案引用過的每一個競品與第三方 URL,而不只是你的。六個量都按引擎索引,所以五個引擎就是三十個數字。
定義

被叫做 AI 能見度的是哪六個量?

有六個彼此獨立的量掛著 AI 能見度這個名字在跑,而一個典型的儀表板只回報其中兩個。下面每一條定義都自成一體,因為這六者經常被彼此替換。

01

提及率

提及率是正文點到你品牌名的答案佔比,不論有沒有掛連結。它是讀者真正體驗到的那個量,因為多數讀者從不點擊來源。

02

引用率

引用率是把你的某個 URL 當成來源掛上去的答案佔比,不論正文有沒有點名。它是六者中唯一能被你的伺服器日誌部分佐證的量。

03

聲量佔比

聲量佔比是你的提及數除以同一答案集合中所有品牌的提及數。它是一個比值,所以競品一動它就動,哪怕你這邊什麼都沒變。

04

答案內位置

答案內位置是你出現在回答的哪一處。這個領域最早的學術指標,用一個隨位置指數衰減的函數來給歸因文本加權。1

05

表述準確度

表述準確度是關於你的那句話是否屬實。它是六者中唯一可以為負的量:一句自信而錯誤的描述,在另外五項上都算成出現了。

06

來源歸屬

來源歸屬是一則答案引用過的全部 URL 清單,包括所有競品的和所有第三方的。它是六者中唯一能告訴你接下來該做什麼的量。

有兩個性質讓這六者不可互換,而且兩者都有據可查,不是斷言。第一,它們回答的是關於管線不同階段的不同問題:2026 年那篇關於生成式引擎優化的批判性綜述,最後落在這樣一句指令上:「做出一個相關、完整、可核驗、結構清晰、且技術上可檢索的頁面;然後分別測量檢索、引用與保真度。」2 檢索、引用、保真度在那句話裡是三種測量,不是一種。

第二,這六個量每一個都是按引擎索引的。SIGIR 2026 上一項 11,500 條查詢的研究測得,Google 自然結果、AI Overviews 與 Gemini 之間 URL 層的 Jaccard 相似度為 0.11–0.18,而這是同一家公司在同一套索引上蓋出的三個介面。3 六個量乘以五個引擎是三十個數字,不是一個;測量 AI 能見度這個階段寫明了它們該以什麼形態回報。

要緊的那道落差

提及率和引用率為什麼會分開走?

提及和引用出自系統的兩個不同半邊,所以兩者之間落差的方向是一個診斷,而不是一件趣聞。引用產生於一份被檢索到的文件被掛到某個句子上;提及產生於模型把你的名字寫進了正文。兩個決定,位置不同,輸入不同。

有連結卻不點名,意味著檢索成功、識別失敗。你的頁面被抓取了、被判定相關了、被掛上去了,然後引擎用的那個段落沒說清楚是誰在說話。這是整個領域裡最容易修的失敗,因為它是你自己頁面上的一個造句問題:被引用的段落寫的是「這個工具每月 $99」,而它本該寫「Bavior 每月 $99」。請把主語放進承載事實的那一句裡,而不是放在兩段之上。

被點名卻沒有連結,意味著模型調用的是訓練資料,而不是它剛檢索到的東西。這是個慢得多的問題。那段描述來自模型訓練所用的語料,你無法檢視、無法編輯,也不能指望它在一個發布週期內改變。站內工作動不了它;能慢慢動它的,是第三方怎麼寫你,那是站外 GEO 這個階段的主題。

這道落差並不小。2026 年 6 月發布的一項廠商研究,涵蓋 115 條 prompt、3,981 次域名出現、四個助手、十四個國家,報告約 62% 的來源出現屬於「答案正文從未點名其品牌」的連結,並發現這個比例在引擎之間是反過來的:一個助手在 83.7% 的答案裡點名品牌,卻只在 21.4% 裡引用;另一個點名 20.7%,引用 87%。4 請把這些百分比當成方向性的:115 條 prompt 的樣本撐不起兩位小數,也不存在任何學術複現。站得住的是那個定性主張:這兩個比率不是彼此的替代指標,在某些引擎上幾乎是反的。

分母

聲量佔比到底取決於什麼?

聲量佔比完全取決於一個由你選定的分母,這讓它成為六者中最容易不幹活也能動的一個。往統計集合裡加兩個小競品,你的佔比就掉;把它們拿掉,佔比就漲。這兩種變動都不是關於引擎的事實。修法是流程性的而非統計性的:在報告裡寫明競品集合,本季度凍結它,並把版本記在每個數字旁邊,這樣兩份報告之間才談得上可比。

還有第二個分母問題,它專屬於基於引用的聲量佔比,而且不是靠紀律能解決的。不同引擎給一則答案掛的來源數量不同。在一項收集了 602 條受控 prompt、21,143 條搜尋層引用的研究中,每則回答的平均引用數為 ChatGPT 6.88、Google 的 AI 介面 12.06、Perplexity 16.35。5 成為七個被引來源之一,和成為十六個之一,不是同一件事。所以基於引用的聲量佔比,在偏好這個問題出現之前就已經不能跨引擎比較了,這也是測量 AI 能見度這個階段裡按引擎拆分並非風格選擇的又一個理由。

基於提及的聲量佔比是兩者中更穩健的一個,因為正文長度在引擎之間的波動遠小於來源數量的波動。就這樣報,並寫明你選的是哪一個。

位置

你出現在答案裡的哪個位置,重要嗎?

答案內位置值得記錄,同時它是六者中作為業務指標證據最弱的一個。它之所以存在,是因為開創這個領域的那篇論文把頭條指標建在了它上面:KDD 2024 的 GEO 論文用位置調整詞數給來源打分,該指標按歸因給某個來源的詞落在回答中的什麼位置,用一個指數衰減的函數加權。1 那是一個定義良好的測量,而它是對著生成答案的其他屬性被驗證的,不是對著點擊、轉換或營收。

兩條規則仍能讓它可用。一是只在整組面板上聚合著讀,因為單一答案的排序只是一個分布中的一次抽樣,而那個分布每次執行都會重擲(AI 答案為何變化)。二是把它當序數讀,而不是當距離讀:三選一裡的第一和十六選一裡的第一,不是同一個位置。

保真度

為什麼表述準確度要單獨計?

表述準確度要單獨計,因為其餘每一個指標都會把一句關於你的假話記成成功。如果某個引擎寫下你的產品沒有免費檔,而事實上你有,並且它還在這句話旁邊掛上了你的定價頁,那麼你的提及率、引用率、聲量佔比和位置全都變好了。唯一朝正確方向變動的那個數字,恰恰沒人在收集。

基礎錯誤率本身就足以證明這份力氣值得花。Tow 數位新聞中心 2025 年 3 月 6 日發布的審計跑了 1,600 條查詢,涵蓋二十家出版方、每家十篇文章、八個引擎,發現超過 60% 回傳了錯誤答案,而表現最好的那個引擎仍有 37% 出錯。6 另一項關於生成式搜尋的獨立研究發現,答案中只有 51.5% 的句子被其所掛的引用完全支撐。7 這兩項研究測的都不是品牌,而它們測的正是這裡要緊的那個性質:掛上連結並不能讓那句話變成真的。姊妹篇站得住的指標寫了怎麼低成本地抽樣測這一項。

第六個量

為什麼要記錄所有人的被引用 URL,而不只是你的?

記錄每一個被引用的 URL,而不只是指向你的那些,正是把一個能見度數字變成這週該做的事的那一步。你自己的比率告訴你身處何處;完整的引用清單告訴你,站在你本該站的位置上的是什麼東西。

由它直接得出三件事。在你的候選清單類 prompt 中反覆出現的第三方頁面,比如一篇對比合集、一條論壇討論串、一個目錄收錄,就是站外工作的靶子,而且是按你自己面板裡的出現頻次排序,不是按任何人的權威分。你自己的頁面會分成被引用過的和從來沒被引用過的兩堆,這把內容待辦清單變成了一份有序的清單。而那些帶著關於你的過時事實的頁面,比如一個舊價格、一個已下線的整合,構成一份更正清單,那是與內容工作不同的另一件活。

這一切只有在日誌是原始記錄時才成立。每次執行請存下:引擎與模式、如果暴露則記錄模型版本、prompt 標識及其類別、時間戳、完整答案原文、按出現順序的每一個被引用 URL,以及一個正文中是否出現你的品牌名的標記。這六個量都能從這條記錄算出來,而從事後補寫的摘要裡則一個都算不出來。2026 年那篇批判性綜述的最低研究清單要求的是同樣的紀律,包括大多數團隊會破壞的那一條:把什麼都沒發生的那些執行留在分母裡。2

本文誠實的邊界

這六個量裡有兩個,沒有任何已發表的證據把它們和企業真正在意的東西連起來。答案內位置來自一個對著生成文本的其他屬性被驗證的指標,從未對著點擊或營收被驗證過。聲量佔比則完全沒有外部驗證:它是一個誰都能自行定義的比值,也沒有研究檢驗過把它推高是否會帶動別的什麼。該領域自己 2026 年的綜述把引用分數能預測點擊、轉換或營收評為極低置信度,而這個評級覆蓋全部六項。上文引用的 62% 有連結不點名,來自一份 115 條 prompt 的廠商樣本,沒有複現。使用這六個量,是因為這套拆分能讓你的決策變得清晰可辨,而不是因為其中任何一個已被證明是銷售的先行指標。

產品派得上用場的地方,和派不上的地方

這六個量你完全可以手工收集,而上面寫的就是全部方法:定一份 prompt 清單,按排程跑,把每則答案連同它引用的 URL 貼進試算表,再標註正文裡有沒有出現你的名字。一個月一百次執行是一個下午的工作量,而它產出的是一個站得住腳的數字。Bavior 按排程把固定的 prompt 面板打到五個引擎上,記錄每一個被引用的 URL(包括不屬於你的那些),並按引擎分別回報,而不是給一個綜合分。它不做的事情是:從這六個量中的任何一個預測流量或營收,因為該領域自己的綜述把這條關聯評為極低置信度;它也不替你判定表述準確度,因為關於你產品的那句話是否屬實,要靠人去讀答案,而不是靠一個分類器。免費 AI 能見度檢測免費 GEO 健檢不需要付費方案;付費方案為按月付費每月 $99 起,或按年付費每月 $79.17(截至 2026 年 8 月 29 日)。

出處,全部核查於 2026 年 8 月 29 日
  1. Aggarwal、Murahari、Rajpurohit、Kalyan、Narasimhan、Deshpande,《GEO: Generative Engine Optimization》,KDD ’24;位置調整詞數用一個隨位置指數衰減的函數給歸因文本加權:arxiv.org/abs/2311.09735
  2. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035;含置信度表、最低研究清單,以及分別測量檢索、引用與保真度的指引(綜述預印本):arxiv.org/abs/2607.14035
  3. Grossman 等,SIGIR 2026;11,500 條查詢;Google 自然結果、AI Overviews 與 Gemini 之間 URL 層級的 Jaccard 為 0.11–0.18:arxiv.org/abs/2604.27790
  4. 幽靈引用研究,2026 年 6 月發布:115 條 prompt、3,981 次域名出現、四個助手、十四個國家;約 62% 的來源出現屬於答案從未點名其品牌的連結;一個助手為 83.7% 提及 / 21.4% 引用,另一個為 20.7% / 87%。廠商發布;依本課程的出處規則,只描述、不連結。
  5. Zhang、He、Yao,《From Citation Selection to Citation Absorption: A Measurement Framework for GEO Across AI Search Platforms》,arXiv:2604.25707(預印本);602 條受控 prompt、21,143 條搜尋層引用;每則回答平均引用數 6.88 / 12.06 / 16.35:arxiv.org/abs/2604.25707
  6. Jaźwińska 與 Chandrasekar,Tow 數位新聞中心,《AI Search Has a Citation Problem》,2025 年 3 月 6 日;跨八個引擎的 1,600 條查詢:cjr.org
  7. Liu、Zhang、Liang,《Evaluating Verifiability in Generative Search Engines》,2023;答案中 51.5% 的句子被其引用完全支撐:arxiv.org/abs/2304.09848
常見問題

你想知道的,都在這裡。

提及比引用好,還是反過來?

它們回答的是不同的問題,所以有用的做法是兩個都報、並且讀它們之間的落差。提及是讀者看得見的東西,而多數讀者從不點擊來源,所以一次沒有連結的提及照樣觸達了那個人。引用則是可被機器核驗的那一半:它意味著你的頁面被檢索並被掛上了,而這恰恰是你自己的工作能直接影響的部分。如果你被引用卻沒被點名,就去修頁面上的句子,讓事實和品牌名出現在同一句裡。如果你被點名卻沒被引用,那段描述來自訓練資料,只有第三方發布的內容才會慢慢改變它。

小團隊實際上該追蹤這六個裡的幾個?

四個,而通常被跳過的正是第四個。按引擎分別追蹤提及率和引用率,因為它們會分開走,而分開的方向本身就是一個診斷;追蹤基於提及的聲量佔比,對照一個你明確寫出並凍結的競品集合;並且記錄答案裡每一個被引用的 URL,包括競品的和所有第三方的,因為這份清單是資料中唯一能指出行動的部分。答案內位置值得記錄,但不值得據以決策。表述準確度值得每月人工抽樣一次,而不是每次執行都測,因為它需要有人去讀那句話。

我可以把這六個數字加總成一個能見度分數嗎?

不能,因為它們量綱不同、分母不同,而且加總會毀掉它們唯一能支撐的那些決策。提及率和引用率是佔答案的比例;聲量佔比是品牌之間的比值;位置是序數;表述準確度是由人工判定的陳述佔比。把它們平均,得到的數字既無法告訴你該去修哪個引擎,也無法告訴你六項中哪一項出了問題。更何況每一項都是按引擎測量的:SIGIR 2026 的一項研究測得同一家公司旗下三個介面之間的 URL 層級 Jaccard 只有 0.11–0.18,所以跨引擎的綜合分,平均的是幾乎不重疊的東西。

每次執行該記錄什麼,之後才能把六個量都算出來?

七個欄位,原樣記錄:引擎與模式、如果暴露則記錄模型版本、prompt 標識及其類別、執行時間戳、完整答案原文、按出現順序排列的每一個被引用 URL,以及一個正文中是否出現你的品牌名的標記。這六個量都能從這條記錄算出來,而沒有一個能從事後寫的摘要裡算出來。請保留那些什麼都沒發生的執行:2026 年那篇批判性綜述的最低研究清單明確要求把零結果留在分母裡,而刪掉它們,是一個面板開始自我美化的最常見方式。

Bavior 編輯部

負責研究與維護 Bavior 關於 Reddit 行銷和 AI 搜尋可見度的所有內容。文中每一個數字都註明了來源出處與查證日期,所有外部連結均非聯盟推廣連結。

發現數字有誤?告訴我們,我們會重新查證:support@bavior.com

是六個數字,不是一個。
先從互相矛盾的那兩個開始。

免費試用