結論那一欄並不是按精確度或成本排序,四個站得住的指標裡有好幾個既貴又吵。它排的是「一次變動是否蘊含一個動作」:某個引擎上的提及率下跌,會把你送去看那個引擎的引用清單;而混合分數下跌,不會把你送去任何特定的地方。底下那六個量的定義,寫在姊妹篇六種能見度裡。
本頁內容
四個 GEO 指標站得住:按引擎分別報出、並且附上信賴區間的提及率與引用率,對照一組由你點名並凍結的競品集合算出的聲量佔比,以及由人工在抽樣上閱讀的表述準確度。四個站不住:單一的跨引擎混合分數,按單條 prompt 畫的週環比箭頭,任何由引用推算出來的流量或營收數字,以及情緒評分。混合分數敗得最徹底,因為 SIGIR 2026 一項涵蓋 11,500 條查詢的研究測得,Google 自然結果、AI Overviews 與 Gemini 檢索到的來源之間,Jaccard 相似度只有 0.11 到 0.18。1
關鍵要點- 一個指標站得住的唯一條件,是它一動就會改變某個人接下來做的事。
- 按引擎分別報,並且把信賴區間印出來:跨引擎的平均值會藏起真正動了的那兩個引擎。
- 絕對不要把引用換算成流量或營收。皮尤研究中心發現,使用者在約 1% 的造訪中點了 AI 摘要裡的來源。8
哪些指標經得起檢驗,哪些站不住?
一個指標經得起檢驗的條件,是它一動就會改變某個人接下來做的事;下面八個裡有四個過了這條線,四個沒過。
最有用的是最後一欄:它點出哪一種觀察會證明某次讀數是錯的。
| 指標 | 結論 | 什麼會讓它的讀數變成錯的 |
|---|---|---|
| 按引擎分的提及率,附信賴區間 | 站得住 | 區間與上一期的重疊,或兩期之間面板版本變過 |
| 按引擎分的引用率,附信賴區間 | 站得住 | 它與提及率反向變動,而兩者只報了一個 |
| 聲量佔比,固定競品集合 | 站得住 | 比較窗口之內有品牌進出被統計的集合 |
| 表述準確度,人工閱讀抽樣 | 站得住 | 兩位閱讀者套用同一份評分準則,對超過五分之一的答案意見不一 |
| 答案內位置 | 謹慎使用 | 只讀單一則答案,或拿引用來源數不同的引擎互相比較 |
| 單一的跨引擎混合能見度分數 | 站不住 | 永遠如此:各組成部分獨立變動,所以那個平均值沒有指涉對象 |
| 帶週環比箭頭的單條 prompt 分數 | 站不住 | 那個變動比一條 prompt 跑幾次的區間還小 |
| 由引用推算的流量或營收 | 站不住 | 永遠如此:連結兩者的那個係數從來沒有被測量過 |
跨引擎混合分數為什麼會毀掉它自己支撐的決策?
混合分數會毀掉它自己支撐的決策,是因為能見度指標唯一支撐得起的動作就是「接下來去做哪個引擎」,而跨引擎取平均,刪掉的正好是這條資訊。它幾乎是這個品類裡每一個儀表板的預設輸出。
先看這些引擎彼此共享的東西有多少。SIGIR 2026 一項涵蓋 11,500 條查詢的研究,測得 Google 自然結果、AI Overviews 與 Gemini 之間 URL 層級的 Jaccard 相似度為 0.11–0.18。1 具體地讀它:如果兩個介面各自為同一個問題引用十個 URL,Jaccard 0.15 意味著大約三個同時出現在兩份清單上。而這三個介面出自同一家公司、同一個索引、同一個產品家族;兩個彼此無關的助手,重疊還更少。2026 年那篇批判性綜述用一句值得原樣引述的話下了結論:這些結果「否定了存在全域 GEO 排名這個觀念。能見度是按引擎、按介面分別索引的。」2
現在看取平均會對真實的一週做什麼。假設你的提及率在一個引擎上漲了 8 個百分點,在另一個引擎跌了 6 個,在其餘三個引擎上持平。混合分數大約動半個百分點,報告寫的是「穩定」,而其實有兩個引擎剛剛做了值得去查的事。這裡的失效不是不夠精確,而是這個總量是一個行為良好的平均值,被平均的那些量卻不在測同一件事。這種不一致背後的機制,在引擎是否一致那一篇裡完整推導過。
跨引擎的彙總確實有一種正當用法,而它不是一個分數。去數你在多少個引擎上越過了門檻:「在五個引擎裡的三個上,至少四分之一的答案點到了我們」是一句辯護得了的總結,因為它數的是若干個各自站得住的事實,而不是把一堆不可通約的量平均起來。
表述準確度為什麼是沒人願意買的指標?
表述準確度之所以沒人願意買,是因為它沒辦法自動化,而且會讓報告變難看;它之所以是人人都需要的那一個,是因為其他每一個數字都會把「一段自信卻錯誤的產品描述」算成勝利。它也是這八個裡唯一一個有獨立確立的基礎發生率的指標,而那個基礎發生率很糟。
三次獨立測量,三種不同方法,方向一致。Tow 數位新聞中心 2025 年 3 月 6 日發布的審計跑了 1,600 條查詢(二十家發布商,每家十篇文章,八個引擎),發現超過 60% 回傳了錯誤答案,而表現最好的引擎仍有 37% 的時候是錯的。3 同一個中心 2024 年 11 月針對 200 段引文的研究,發現有 153 則回應部分或完全錯誤,而表達了不確定性的只有七次。4 另有獨立研究發現,答案句子中有 51.5% 被其附上的引用完全支持,5 2026 年一篇預印本則把 98,020 條原子主張裡大約 11% 歸類為支持不足。6 最後那個數字比較低,是因為它數的是主張而不是回應,而一則回應只要裡面有任何一條主張是錯的,這則回應就是錯的。你喜歡引哪一個都行,但要把它的單位一起帶上。
在你自己的產品上量它,比那些研究聽起來便宜得多。每個月抽樣二十則答案,並且往「出錯就會丟掉一單」的那幾類上加權:對比類和反對意見類的 prompt。拿一份固定的評分準則逐則打分,準則上放幾個事實軸:定價模式、產品做什麼、產品不做什麼、整合,以及任何安全或合規主張。每個軸記一個二元值而不是一個情緒值,並且把錯的那句話原樣留下來,好拿去給產出那個頁面的人看。兩位閱讀者應該在五則裡有四則達成一致;如果沒有,那是評分準則太模糊,而不是引擎太反覆無常。
它的產出不是一張投影片上的百分比,而是一份具體的錯誤句子清單,以及最有可能造成這些句子的那些頁面。拿這份清單怎麼辦,寫在引用準確度那一篇。
聲量佔比為什麼脆弱?
聲量佔比脆弱,是因為它是唯一一個分母出自判斷的倖存指標,所以世界上什麼都沒發生,它也能被挪動好幾個百分點。往被統計的集合裡加兩個次要競品,你的佔比就降;悄悄把它們拿掉,佔比就升。解法不是統計上的:點名這個競品集合,一季之內凍結它,給它編版本,並且把版本印在數字旁邊。
第二種脆弱是結構性的,紀律修不了,只能揭露。以引用為基礎的聲量佔比,分母隨引擎而異,因為不同引擎掛在一則答案上的來源數量差很多。一份 2026 年 6 月 26 日發布、建立在 2026 年 1 月至 4 月間採集的 1.26 億條美國 AI 搜尋 prompt 之上的廠商指數回報,某個助手每則回應平均引用約 15 個來源,另一個助手約 3 個。7 這個方向有學術界對「每則回應引用數」的測量佐證,所以請把這個比例當成真的,把確切的平均值當成指示性的。「是三個被引來源之一」和「是十五個被引來源之一」是不同的事件,所以以引用為基礎的佔比不能跨引擎比較,以提及為基礎的佔比才是比較安全的預設選擇。
哪些數字根本不該進到儀表板上?
有四個數字根本不該進到儀表板,而且每一個失敗的理由都不是「不夠精確」。第一個是任何由引用推算出來的流量或營收數字。能夠許可這種換算的係數從來沒有被測量過:這個領域自己 2026 年的綜述,把「引用分數能預測點擊、轉換或營收」評為極低置信度,2 而皮尤研究中心 2025 年 7 月的瀏覽行為研究發現,使用者在約 1% 的造訪中點了 AI 摘要裡的來源。8 拿一個引用計數去乘一個憑空發明的點擊率,得到的是一個誤差項未知、卻帶著小數點的數字,不是一個估計值。
第二個是帶週環比箭頭的單條 prompt 分數:一條 prompt 跑那麼幾次,帶著的區間遠比任何值得報告的變動更寬,所以那根箭頭是畫在雜訊上的,而算術寫在姊妹篇統計檢定力裡。第三個是情緒評分,它把你需要的訊號壓扁了:一則答案可以語氣溫暖,同時把你的定價模式講錯,而丟掉這一單的正是那個錯誤。
第四個是任何沒有把公式印在旁邊的複合指數。如果一個數字是出現、位置與顯著性的加權混合,那麼權重才是結論本身,而一個看不到權重的讀者,沒辦法檢查上一季那個數字是不是用同樣的方式算出來的。有公開公式的指數是一個指標;沒有公式的指數是一個主張。
怎麼判斷一個新指標值不值得加?
拿四個問題去問一個候選指標,四個都答得出來才加。它有沒有一個你能控制、也說得出來的分母?如果分母是引擎的流量、prompt 量或使用者規模,你說不出來,這個指標就是一個戴著百分號的猜測。你能不能算出它周圍的區間?如果那個觀察不是「在一組可數的執行次數上發生的可數事件」,就沒有區間,也就沒辦法把一次變化和一次波動分開。
它一動,會不會有某個決策跟著改?在你開始收集任何資料之前,先寫下:一次兩倍標準誤的變動會觸發哪個具體動作。如果你講不出一個,那這個指標就是一個注意力有限的頁面上的裝飾。它能不能被證偽?點出哪一種觀察會顯示某次讀數是錯的;上面那張表的最後一欄,存在的目的就是逼出這件事。一個沒有證偽觀察的指標,描述的是一種心情,而不是在測量什麼。
拿你現有的儀表板過一遍同樣這四個問題:多數專案裡,光第三個問題就會刷掉兩到三個面板。
這一頁上的結論是論證,不是測量。沒有任何研究把這八個指標放在一起、就預測效度做過正面比較,因為那需要一個可被預測的結果,而所有人想要的那個結果,也就是營收,恰恰是這個領域自己的綜述評為極低置信度的那一個。所以這裡的「站得住」意思是「有一個說得出來的分母、一個算得出來的區間,以及一個掛在上面的決策」,而不是「已經被證明能帶來銷售」。表述準確度是這幾個倖存者裡定義最弱的一個:沒有標準評分準則,這項任務也沒有已發表的評分者間一致度,而上面引的那些基礎發生率,來自針對新聞發布商而不是針對產品的研究。
上面的每一件事都能在試算表裡做完:把面板固定下來、跑它、按引擎分別統計「正文點名」和「掛了 URL」兩種情況、對每一個算一個二項式區間,然後每個月照著你自己寫的評分準則讀二十則答案。Bavior 按排程把一組固定的 prompt 面板打到五個引擎上,按引擎分別回報而不是回報一個混合分數,並且記錄每一個被引用的 URL,包括不屬於你的那些。它不做的是由引用預測流量或營收,因為那個係數並不存在。它也不評表述準確度,因為判斷一句關於你產品的話是否屬實,是一個人照著你的評分準則去讀答案,不是一個分類器。免費 AI 能見度檢測與免費 GEO 健檢不需要付費方案;付費方案為按月付費每月 $99 起,或按年付費每月 $79.17(截至 2026 年 8 月 29 日)。
- Grossman 等,SIGIR 2026;11,500 條查詢;Google 自然結果、AI Overviews 與 Gemini 之間 URL 層級的 Jaccard 為 0.11–0.18:arxiv.org/abs/2604.27790
- 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035;置信度表,以及「這些結果否定了存在全域 GEO 排名這個觀念。能見度是按引擎、按介面分別索引的」(綜述預印本):arxiv.org/abs/2607.14035
- Jaźwińska 與 Chandrasekar,Tow 數位新聞中心,《AI Search Has a Citation Problem》,2025 年 3 月 6 日;1,600 條查詢,20 家發布商,8 個引擎;超過 60% 有誤:cjr.org
- Tow 數位新聞中心,《How ChatGPT Search (Mis)represents Publisher Content》,2024 年 11 月;來自 20 家發布商的 200 段引文;200 則回應中有 153 則部分或完全錯誤:cjr.org
- Liu、Zhang、Liang,《Evaluating Verifiability in Generative Search Engines》,2023;51.5% 的句子被其引用完全支持:arxiv.org/abs/2304.09848
- Xu、Iqbal 與 Montgomery,2026;98,020 條原子主張中約 11% 被歸類為支持不足(預印本):arxiv.org/abs/2605.14021
- AI 能見度指數,2026 年 6 月 26 日發布:2026 年 1 月至 4 月間採集的 1.26 億條美國 AI 搜尋 prompt;某個助手每則回應平均引用約 15 個來源,另一個約 3 個;36 個品牌在所涵蓋的每一個平台上都可見。廠商發布;依本課程的出處規則,只描述、不連結。
- 皮尤研究中心,2025 年 7 月 22 日;使用者在約 1% 的造訪中點了 AI 摘要裡的來源:pewresearch.org
你想知道的,都在這裡。
有沒有一個我該瞄準的 AI 能見度分數基準?
沒有,而且任何被拿來當基準的數字,比的都是彼此不可比的面板。你的比率是你挑的那些 prompt 的函數:一個測量漏斗底部窄問題的團隊,數字會比一個針對同一個產品測量寬泛品類問題的團隊低,而這兩個數字誰也說明不了誰。有意義的比較有兩種:你自己的面板在固定版本下跟自己比,以及在同一天、同一個面板裡,對一組點名的競品集合算聲量佔比。兩種都是內部的,而這正是它們辯護得了的原因。
我的儀表板只顯示一個 AI 能見度分數。它沒用嗎?
它當預警線不是沒用,當診斷才是沒用,而這個區分值得記住。一個混合出來的單一數字,可以告訴你有東西動得夠大、值得去看。它沒辦法告訴你是哪個引擎動了,而既然 SIGIR 2026 一項研究測得,同一家公司做的三個介面之間 URL 層級的 Jaccard 只有 0.11–0.18,那些組成部分就接近彼此獨立。如果它已經在頁面上,就留著它,在它底下把按引擎分開的拆解印出來,並且確保任何人採取的每一個動作,都是由那份拆解而不是由這個混合分數觸發的。
不請人的話,我要怎麼測表述準確度?
每個月照著一份固定的評分準則讀二十則答案,每個事實軸記成二元值。挑那些會讓你丟單的軸:定價模式、產品做什麼、產品不做什麼、整合,以及任何合規或安全主張。把錯的那句話原樣記下來,而不是記一個分數,因為你能據以行動的是那句話。抽樣要往對比類和反對意見類的 prompt 加權,那裡出錯最貴。兩位閱讀者應該在五則裡至少有四則達成一致;沒有的話,那是評分準則太模糊,而不是引擎太反覆無常。
為什麼我不能把引用換算成一個預估流量數字?
因為你要乘上去的那個係數從來沒有被測量過,而唯一一個相關的公開數字說它接近零。皮尤研究中心 2025 年 7 月的瀏覽行為研究發現,使用者在約 1% 的造訪中點了 AI 摘要裡的來源,而這個領域自己 2026 年的綜述,把「引用分數能預測點擊、轉換或營收」評為極低置信度。你還是可以把一個建模假設大聲說出來,「如果 1% 的讀者會點擊,而這個問題被問了 N 次」,前提是你把它當成一個 N 未知的假設來呈現,而不是當成一次測量。它一旦以圖表的形式出現,就會被當成測量結果引用。
負責研究與維護 Bavior 關於 Reddit 行銷和 AI 搜尋可見度的所有內容。文中每一個數字都註明了來源出處與查證日期,所有外部連結均非聯盟推廣連結。
發現數字有誤?告訴我們,我們會重新查證:support@bavior.com