首頁/學習 GEO/測不到的東西
測量 AI 能見度 · 邊界

AI 能見度測量的邊界在哪裡?

這個領域有四個問題根本沒有儀器,而假裝有,正是 GEO 報告失去公信力的主要途徑。有用的做法是把每一個的邊界大聲說出來,而不是悄悄估一個數。

本頁內容
分享本文
分享到 X 分享到 LinkedIn
簡短回答

AI 能見度裡有四件事沒有儀器:一條 prompt 被問過多少次、一次引用帶來了多少收入、模型不搜尋時怎麼描述你,以及某一個買家實際看到的那條答案。每一件缺的都是它本來需要的那個觀測值,而不是在等一個更好的工具,所以請大聲把邊界劃出來,而不是悄悄估一個數。就第二件事而言,皮尤研究中心 2025 年 3 月的瀏覽面板發現,在載有 Google AI 摘要的頁面造訪中,使用者只有 1% 點了摘要裡的連結,所以這類觸點大多不會留下任何可供分析工具記錄的事件。2

關鍵要點
  • 報覆蓋度,不要報量級:沒有任何引擎公開 prompt 頻次,所以提及率描述的是你選的那些問題,永遠不是市佔率。
  • 不要把引用換算成收入。該領域自己 2026 年的綜述,把「引用分數可以預測點擊、轉換或收入」評為極低置信度,也就是它的最低一檔。3
  • 用三句話替每一個缺口劃出邊界:說出被估量,說出你手上實際有的儀器,再說出什麼樣的觀測會顯示這個讀數是錯的。
缺失的分母

為什麼沒有人能告訴你,你的 prompt 被問過多少次?

沒有任何引擎公開 prompt 頻次,也沒有任何東西能把它還原,所以你報出的每一個比率,分子是你量到的,分母是你編出來的。這個數字為什麼不存在,以及廠商給出的 提示詞搜尋量到底是由什麼拼出來的,沒有提示詞搜尋量那一篇有完整推演。對一份報告來說要緊的是後果:你的提及率是你所選那些問題的性質,不是市場的性質。

這對一份報告可以主張什麼,有一個具體影響。「我們在 34% 的答案裡被點名」是一句關於你面板的、辯護得了的話。「我們在本品類 34% 的 AI 答案裡被點名」不是,因為後一句暗含了一個誰都沒有的分母。把面板寫進句子裡,這句主張就成真了。

你拿得到的邊界是覆蓋度,不是量級。把你觀察得到的需求拿出來:你自己搜尋後台裡的問句型查詢、探索型通話的第一個問題、試用第一週開出的工單。說明你的面板佔了其中多大比例,你就有了一個帶著真實分母的真實分數,也是這裡能做出的最強覆蓋度主張。有一個已發表的信號能幫你替面板加權:一項採集於 2026 年 3 月 13 日至 4 月 21 日、共 55,393 條查詢的研究測得,Google AI Overview 的整體觸發率是 13.7%,而問句形式的查詢是 64.7%。1 AI 答案就發生在問句型的 prompt 上,所以一個往它們傾斜的面板,量的正是這個介面真正存在的地方。

歸因

一次引用能歸因到收入嗎?

不能,而原因是機制性的,不是統計性的:在通常情況下讀者根本不點,所以沒有任何事件可供分析系統記錄。皮尤研究中心 2025 年 3 月的瀏覽面板測得,點擊 AI 摘要內來源的比例約為造訪的 1%;至於一次引用作為曝光值多少,GEO 改變了什麼那一篇有談。2 該領域自己 2026 年的綜述,把「引用分數可以預測點擊、轉換或收入」這個主張評為極低置信度,也就是它的最低一檔。3

有三個機制切斷了這條鏈,而知道當下起作用的是哪一個,才知道哪種繞行方案值得一試。第一是缺失的點擊:一個被答案滿足了的讀者,永遠不會變成一個工作階段。第二是缺失的 referrer:聊天客戶端常常根本不送,所以確實發生過的造訪會以直接流量的形式抵達。第三是無法區分的代理:Tow 數位新聞中心 2025 年 10 月 30 日發表的分析寫道,對一個網站來說,代理型瀏覽器裡的代理「與一個使用標準 Chrome 瀏覽器的人無法區分」,而且這類瀏覽器取到了同一批廠商的標準介面取不到的訂閱專屬內容。4 這一類流量增長很快:Cloudflare 的全網 2025 年度回顧報告,使用者觸發的抓取在這一年裡增長超過十五倍。5 因此,你的 AI 中介觸點裡在分析工具中看不見的那一部分,佔比是在上升,不是下降。

沒有任何繞行方案能把那個缺失的係數找回來,凡是被端出來當成解方的東西都值得你懷疑。請改成把一個建模假設寫成一句話,輸入項寫明,未知項標為未知,而且絕不要畫成圖表。圖表到第二次開會時就會被當成測量結果引用。

另一個答案

模型不做檢索時說了什麼,測得到嗎?

抽樣可以,隨時間追蹤不行,因為儀器會在你腳下改變。當模型不搜尋就作答時,對你產品的描述來自你檢查不了、編輯不了、也沒辦法按計畫去影響的訓練資料。今天要抽一次樣很容易:把搜尋關掉問一次,讀回來的內容就是。問題出在第二次測量。

時間序列需要一件固定的儀器,而模型不是。每一次發版都是新的語料、新的資料截止日期和新的後訓練,所以兩次無搜尋測量之間的變化,可能是你的聲譽變了,也可能是模型變了,而資料裡沒有任何東西能區分這兩者。連版本標籤往往也幫不上忙:同一個產品名可以在不公告的情況下被路由到不同的 checkpoint。2026 年那篇批判性綜述把「商業引擎彼此不同,而且會隨時間變化」評為置信度,而一條不檢索的時間序列,恰恰需要不受這件事影響。3

所以請把無搜尋的那一次執行當成一張定期快照,蓋上模型版本,用質性的方式讀。它回答的是一個真正有用的問題:這個系統在什麼都不讀的時候,認為我們是什麼。它同時也是你最早能拿到的警訊:一則關於你產品的錯誤事實,已經沉澱進語料裡了。把它以引述原文的形式,連同日期與版本一起報出來,絕不要畫成趨勢線。

一次執行,一個工作階段

真實買家實際看到的那條答案,測得到嗎?

不行,而這條限制最常被誤當成資料裡的雜訊。面板跑的是無塵室式的工作階段:全新的上下文、沒有登入帳號、固定的地區、搜尋開著、每條 prompt 只跑一次。買家不會把這裡面的任何一項摁住不動。Anthropic 在文件裡寫明,Claude「會在你聊天的過程中,把記憶存成一個個獨立的主題」,並把它帶進後續對話,同時讓使用者可以把它關掉;於是兩個問同一個問題的人,並不是在問同一個系統。7 你跑的任何一次,都複現不出他們的狀態。

另一半是非確定性,而它和個人化不同,至少還量得出來。2026 年 3 月那篇談 AI 能見度的統計學論文寫道,「引用排名在不同樣本之間並不穩定,不只是排名靠前的網域,整個高頻被引網域集合都是如此」,而自助法區間顯示,網域之間許多看起來存在的差異,其實落在「這套測量流程的噪聲基底」之內。6 2026 年那篇批判性綜述從審計那一側記錄了同樣的圖景:商業審計顯示出「很低的來源重合度、相當大的逐次執行波動,以及持續存在的保真度缺口」。3

由此得出的實操規則是:不要再把一次執行當成一次觀測。把每一條 prompt 重複跑,用區間而不是點估計來報比率,週對週的變動只有在超出那個區間之後才算真的;該綜述自己的檢查清單也正是出於這個理由,要求研究做多種改寫與重複執行。3 要重複多少次是算術,統計檢定力那一篇算清楚了。重複永遠換不來的,是那位買家自己的那條答案;它始終觀測不到,所以請把你的工作階段設定寫在數字旁邊,而不是塞進附錄。

代理指標

哪些代理指標值得留下,又該怎麼標註?

有三個代理指標值得留下,而每一個都只有在帶上一句明確標註、寫清楚它撐不起什麼的時候,才是安全的。

01

自陳歸因

註冊時那個自由填寫的「你從哪裡知道我們的」欄位,是買家唯一能告訴你「有一個助手參與其中」的地方。標註:自選填答、未經提示,而且會被記不得那次觸點的人系統性低報。

02

高意圖頁面的爬蟲抓取

搜尋側與使用者觸發的抓取打到你的定價頁與對比頁,是真實的需求信號,讀爬蟲日誌那一篇有談。標註:興趣的先行指標,不是結果,也無法歸因到某一個人。

03

品牌搜尋與直接流量

品牌搜尋或直接造訪和提及率一起上升,是很弱的旁證。標註:與同一時間窗裡其他每一項行銷活動混淆在一起,而且沒有對照期就毫無用處。

這裡的紀律全在那句標註上。一個被剝掉但書的代理指標,在轉述裡就變成了測量結果,所以請把但書寫進圖表標題,而不是腳註;這樣當那張投影片在你不在場的情況下被轉發時,數字還是誠實的。

方法

測不到的問題,要怎麼替它劃出邊界?

替一個問題劃出邊界,意思是用一個寫明的範圍加一個寫明的假設去回答它,而不是給一個點估計;這件事需要三句話。說出被估量:把你真正想知道的東西精確寫下來,例如「上一季有多少買家是在助手裡形成了對我們的看法」,因為含糊的版本正是讓代理指標悄悄頂替它的原因。說出儀器:說清楚你手上實際有什麼、它量的是什麼,於是一個 200 次觀測的面板,量的是在某個日期區間、在五個引擎上,你所選的那些問題裡有多大比例點名了你。說出證偽條件:說清楚什麼樣的觀測會顯示這個讀數是錯的;對一個邊界來說,這通常意味著點出那個一旦不成立就會讓它垮掉的假設。

寫出來的話,一個劃了邊界的主張長這樣:「在我們 60 條 prompt 的面板上,七月份五個引擎裡有四個在 28–36% 的答案中點名了我們,每個引擎 200 次觀測。我們不知道這些問題被問過多少次,所以這不是市佔率。如果我們的買家問的問題和我們的面板有實質差異,這個數字就描述不了他們。」這一段比多數的執行摘要還短,而且沒辦法被斷章取義,這正是重點。

研究文獻對自己提的也是同一套紀律。2026 年那篇批判性綜述的建議是先做出一個可檢索的頁面,然後「把檢索、引用與保真度分開量」;它的最低研究標準檢查清單要求,每一次讀數都要記錄產品、模式、模型、日期、地區、帳號,以及搜尋是否啟用,而且零結果要保留下來,不能丟掉。3 這些都不會攔著你去測量。它們攔的是:讓一次測量去扛一個它從來就不是為此而造的主張。

本文誠實的邊界

這裡描述的四條限制在今天是結構性的,不是自然律,其中兩條有可能被關上。如果哪天有引擎公開了 prompt 頻次,或者助手開始送出一致的 referrer,本頁前兩節在一個季度內就會過時,而這會不會發生,事先無從得知。另外兩條更難:一條不檢索的時間序列需要固定的儀器,而重新訓練過的模型不是;至於某一個人看到的那條答案,除了他自己沒有人觀測得到。這裡引用的最強的那個數字也要小心。大約 1% 的點擊數字來自 2025 年 3 月一項 900 名美國成年人的行為面板,量的專門是 Google AI 摘要;它是目前拿得到的最好的獨立證據,同時它也只是一項研究、一個介面、一個國家、一個月份。

產品派得上用場的地方,和派不上的地方

劃邊界不花錢,只花紀律:把被估量、儀器和證偽條件寫進報告,在註冊環節加一個自由填寫的來源欄位,並且停止把引用換算成工作階段。Bavior 按排程把一組固定的 prompt 面板打到五個引擎上,記錄每一個被引用的 URL(包括不屬於你的那些),並且按引擎分別回報,而不是給一個混合分數。它不做的,正是本頁這四件事:它無法告訴你一個問題被問過多少次,因為沒有引擎公開這個;它不由引用去預測流量或收入,因為該領域自己的綜述把這條關聯評為極低置信度;它也無法告訴你模型在不搜尋時認為你是什麼,最多只能讓你自己去讀一張快照;它更無法把某一個買家看到的那條答案拿給你看,因為那個工作階段是他自己的。免費 AI 能見度檢測免費 GEO 健檢不需要付費方案;付費方案為按月付費每月 $99 起,或按年付費每月 $79.17(截至 2026 年 8 月 29 日)。

出處,全部核查於 2026 年 8 月 30 日
  1. Xu、Iqbal 與 Montgomery,2026;55,393 條查詢,採集於 2026 年 3 月 13 日至 4 月 21 日;「AIO 整體觸發率為 13.7%,問句形式的查詢升至 64.7%」(預印本):arxiv.org/abs/2605.14021
  2. 皮尤研究中心,2025 年 7 月 22 日;900 名美國成年人的瀏覽面板,68,879 次搜尋,2025 年 3 月;關於點擊 AI 摘要內的連結,「這只發生在所有造訪帶有此類摘要頁面的 1% 裡」:pewresearch.org
  3. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035;置信度表與最低研究標準檢查清單(綜述預印本):arxiv.org/abs/2607.14035
  4. Chandrasekar 與 Jaźwińska,Tow 數位新聞中心,《How AI browsers sneak past blockers and paywalls》,2025 年 10 月 30 日;代理型瀏覽器「與一個使用標準 Chrome 瀏覽器的人無法區分」:cjr.org
  5. Cloudflare Radar 2025 年度回顧,資料期間 2025 年 1 月 1 日至 12 月 2 日;「AI『使用者動作』抓取在 2025 年增長超過 15 倍」:blog.cloudflare.com
  6. Sielinski,《Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement》,2026 年 3 月,2026 年 8 月 26 日修訂,arXiv:2603.08924(預印本):arxiv.org/abs/2603.08924
  7. Anthropic,《Use Claude’s chat search and memory to build on previous context》(記憶跨對話保存,使用者可自行控制;一手來源):support.claude.com/en/articles/11817273
常見問題

你想知道的,都在這裡。

我怎麼知道有多少人在向 AI 詢問我這個品類?

你做不到,因為沒有任何引擎公開 prompt 頻次,也沒有任何代理指標能把它還原。你能誠實測量的是覆蓋度,不是量級:把你真的觀察到買家在問的那些問題拿出來,也就是你自己搜尋後台裡的問句型查詢、探索型通話的第一個問題、試用期間開出的工單,然後說明你的面板包含了其中多大比例。「這個面板涵蓋了我們觀察到的 55 個不同問題裡的 40 個」是一句有真實分母的真話。「我們出現在本品類 34% 的 AI 答案裡」不是,因為那個分母誰都沒有。

我可以給董事會一個 AI 能見度的收入數字嗎?

不能當成測量結果,但你可以改成給一個劃了邊界的主張。從引用到收入的這條鏈在三個地方斷掉。讀者通常不點,而皮尤研究中心 2025 年 3 月的瀏覽面板測得,點擊 AI 摘要內來源的比例約為 1%。聊天客戶端常常不送 referrer,所以確實發生過的造訪會以直接流量的形式抵達。而代理型瀏覽器在伺服器日誌裡與一個真人無法區分。請寫一句話,把假設點出來、把未知標為未知,並且不要做成圖表,因為圖表會被當成測量結果引用。

搜尋關掉時模型怎麼說我,我該追蹤嗎?

定期抽樣,蓋上模型版本,把它當文字讀,而不是畫成圖。無搜尋的答案來自你檢查不了也編輯不了的訓練資料,這讓它成為最早的警訊:一則關於你產品的錯誤事實已經沉澱進語料裡,而這確實值得知道。它撐不起的是時間序列,因為每一次模型發版都是新的語料和新的資料截止日期,所以兩次測量之間的變化可能是模型變了,而不是你的聲譽變了,而資料裡沒有任何東西能把這兩者分開。

替一個問題劃出邊界,和估計它,差別在哪裡?

估計給的是一個點值,並且把假設藏起來;邊界給的是一個範圍,並且把假設說出來。劃邊界需要三句話:說出被估量,也就是你真正想知道的東西究竟是什麼;說出儀器,也就是你手上實際有什麼、它量的是什麼,包含面板、引擎和日期區間;再說出證偽條件,也就是什麼樣的觀測會顯示這個讀數是錯的。「在我們 60 條 prompt 的面板上,七月份五個引擎裡有四個在 28–36% 的答案中點名了我們,每個引擎 200 次觀測;我們不知道這些問題被問過多少次,所以這不是市佔率」沒辦法被斷章取義,而這正是它全部的好處。

Bavior 編輯部

負責研究與維護 Bavior 關於 Reddit 行銷和 AI 搜尋可見度的所有內容。文中每一個數字都註明了來源出處與查證日期,所有外部連結均非聯盟推廣連結。

發現數字有誤?告訴我們,我們會重新查證:support@bavior.com

把測不到的東西劃出邊界。
剩下的才信得過。

免費試用