首頁/學習 GEO/統計檢定力
測量 AI 能見度 · 那個計算

一次前後對比,需要多大的統計檢定力?

有一個公式決定了你的前後對比有沒有意義,而它短到可以手算。本頁的每一個數字都由它推出,包括關於週報的那個不太好聽的結論。

本頁內容
分享本文
分享到 X 分享到 LinkedIn
簡短回答

一次前後對比需要多少次觀測,取決於你願意據以行動的最小變化;兩比例樣本量公式會告訴你具體數字:n = (1.96 + 0.84)² × [p₁(1−p₁) + p₂(1−p₂)] ÷ δ²,取檢定力 80%、雙側 5% 顯著水準。從 30% 的基線出發,偵測 10 個百分點的變化約需每週期 353 次觀測,偵測 2 個百分點約需 8,400 次;因此一份每個引擎 200 次觀測的週報,只能分辨出約 13 到 14 個百分點,再小就不行。檢定力不足是已發表研究的常態:2013 年一篇回顧涵蓋 49 項統合分析、共 730 項研究,得出的統計檢定力中位數是 21%。10

關鍵要點
  • 數的是觀測數,不是 prompt 條數。一次觀測是一條 prompt 在一個引擎上執行一次,所以 60 條 prompt 執行六次就是 360 次。
  • 需求量是平方關係:想偵測的變化減半,需要的資料就翻兩番。心算用「觀測數 ≈ 3.5 ÷ δ²」就足以在會議上核一遍。
  • 一個週度數字,誠實地說撐不起一根趨勢箭頭。請按月發布;面板穩定時採用配對設計;並留下一組你從不針對性優化的 prompt,好讓引擎漂移不會被讀成你的效果。
公式

前後對比的樣本量公式是什麼?

比較兩個比率用的是普通的兩比例公式,本頁的每一個數字都由它推出:n = (zα/2 + zβ)² × [p₁(1−p₁) + p₂(1−p₂)] ÷ (p₂ − p₁)²。在慣例設定下,也就是雙側 5% 顯著水準故 zα/2 = 1.96、檢定力 80% 故 zβ = 0.84,前面那個常數就是 2.8² = 7.84。

每一項都是你在收集任何資料之前就必須定下來的東西。p₁ 是你出發時的比率,要實測,不能猜。p₂ 是你希望自己有能力偵測到的比率,這是一個業務決定:能改變你下一季投什麼的那個最小改進幅度。δ = p₂ − p₁ 就是這個差值,以小數寫出。而 n 是每一個週期裡的觀測數,其中一次觀測是一條 prompt 在一個引擎上執行一次。

手算一行,其餘就都可核對了。從 30% 到 40%:0.30 × 0.70 = 0.21,加上 0.40 × 0.60 = 0.24,兩者之和 0.45,乘以 7.84 得 3.528,再除以 δ² = 0.01,得 352.8。也就是前期 353 次觀測、後期 353 次。

這一切都不是 AI 搜尋特有的:它是任何二值結果比較都適用的算術,而上面這個版本是流通中的兩個裡較小的那一個。多數計算器跑的是 Casagrande、Pike 與 Smith 的連續性校正公式,它給出的 n 更大,所以請把本頁每一個數字都讀作下限。6 「一個比率的精度」和「兩個比率之差的可偵測性」是兩種不同的計算,按前者定尺寸的面板用在後者上往往太小;按精度定尺寸屬於 prompt 調研的面板規模那一篇。

數字

每種幅度的變化各需要多少次觀測?

全部從 30% 的起始比率算起、按引擎計:20 個百分點的變化約需每週期 91 次觀測,10 個百分點約 353 次,5 個百分點約 1,372 次,2 個百分點約 8,400 次。中間那一欄是變異數項。

要偵測的變化p₁(1−p₁) + p₂(1−p₂)每週期觀測數能達成它的面板
30% → 50%(20 個百分點)0.460約 9120 條 prompt × 5 次
30% → 40%(10 個百分點)0.450約 35360 條 prompt × 6 次
30% → 35%(5 個百分點)0.438約 1,37260 條 prompt × 23 次,做不到每週
30% → 32%(2 個百分點)0.428約 8,400在任何合理節奏下都達不到

有兩個性質比其中任何一行都更要緊。第一:需求量與 δ 成平方關係,所以想偵測的效應減半,需要的資料就翻兩番。這就是為什麼第一行和最後一行之間只差十八個百分點,樣本量卻差了約九十倍;而它決定了一個專案負擔得起什麼樣的匯報節奏。

第二,變異數項幾乎不動,整張表裡只在 0.428 到 0.460 之間,所以幾乎全部的變化都來自 δ 本身。這給了一個在這個範圍內誤差約 5% 以內的捷徑:觀測數 ≈ 3.5 ÷ δ²,δ 以小數計。

後果

一份 200 次觀測的週報能偵測到什麼?

一份每個引擎帶 200 次觀測的週報,能偵測到約 13 到 14 個百分點的變化。把捷徑反過來用:3.5 ÷ 200 = 0.0175,開平方是 0.132;用精確公式從 30% 的基線算,約為 13.5 個百分點。從 30% 漲到 44% 剛好在可偵測的邊緣上;從 30% 漲到 35% 是看不見的,不管儀表板把它畫得多麼篤定。

這個推論不太好聽:一份 GEO 週報,誠實地說,除了大幅變動之外什麼都偵測不到。比這更小的都是波動;把它當成進展來匯報,就是一個專案在第四個月、曲線毫無理由地回落時失去公信力的方式。

同一套算術也說了該怎麼讀一份已發表的案例研究:手上要有樣本量。生成式引擎優化最出名的那句主張,GEO 能把能見度提升 40%,被 2026 年那篇批判性綜述列為作為一般性主張予以駁回,因為這個數字是開山論文裡「在特定配置下、某一個指標上的相對最大值」,而那篇論文測的是固定上下文內的一個位置加權指標,不是真實引擎上的能見度。24 多數案例失敗得更安靜:當有人寫下改寫之後能見度從 22% 升到 27%,該問的是每個數字背後有多少次觀測;每邊低於約 1,400 次時,那個對比就無法把效應與噪聲分開。這是檢定力不足,不是不誠實,而這一條同樣適用於我們自己發布的任何東西。

M 型與 S 型錯誤

檢定力不足的檢定給出顯著結果時,誇大了什麼?

誇大的是它自己的效應量,而且倍數可以事先算出來。檢定力低的時候,只有那些衝過了頭的估計才夠得著顯著性門檻,所以「以顯著性篩選」本身就是在篩選誇大。Gelman 與 Carlin 把這個失真稱為誇大比,也就是「效應量可能被高估的倍數」,並把它與 S 型錯誤配成一對:後者是顯著估計把符號弄反了的機率。9

它落到實處是這樣:一個只夠偵測 13 個百分點的對比,在真實效應只有 4 個百分點、而它偶爾給出顯著結果的那些場合,報出來的數會比 4 大得多。這不是檢定的毛病,這就是對一個含噪估計施加顯著性篩選的結果;也正因如此,一個 GEO 專案的第一季常常產出一個誰也複現不了的數字。

這是已發表研究的常態,不是個別角落:2013 年確立此論點的那篇回顧,給出 49 項神經科學統合分析、共 730 項研究的統計檢定力中位數為 21%。10 目前沒有針對 AI 能見度案例研究的同類審計,而既然它們大多只執行一次,穩妥的假設是這個數字更低。應對辦法不是更聰明的檢定:在看資料之前就把多大的效應你才會據以行動定下來,並把第一個顯著結果當成一個待重跑的假設,而不是一個可以宣布的發現。

三個槓桿

不增加執行次數,怎麼買到檢定力?

有三個槓桿能在不給日程加一次執行的前提下,提高一次對比的可偵測幅度:拉長週期、在 prompt 類別內合併、採用配對設計。它們作用在對比上而不是面板上,所以可以和 prompt 調研裡「prompt 條數對執行次數」的分配疊加使用。

拉長週期。月度對比會把你本來就在做的四週執行聚合起來,於是 200 次觀測變成 800 次,可偵測效應從約 13.5 個百分點降到約 6.6 個。請注意這個兌換率:四倍的資料只買到兩倍的解析度,因為需求量是平方關係。光靠耐心救不回週度節奏;它必須被放棄作為匯報單位,只保留為運營檢查。

在 prompt 類別內合併。比較一整類 prompt 的前後變化,而不是單一條 prompt,反正內容改動本來就該在類別層面顯現。紀律在於只在同一類別內合併,絕不跨類別:各類別是獨立變動的,把你漲了十二個百分點的那一類和四個持平的類別混在一起,會把一個真實效應稀釋成偵測不到的效應,那樣合併就不是買到檢定力,而是賠掉了檢定力。跨引擎合併更糟,因為它們檢索到的來源幾乎不重疊。3

採用配對設計。前後執行完全相同的面板,用 McNemar 檢定逐條 prompt 比較;它只用那些狀態發生了改變的 prompt,因此把 prompt 之間的變異整個從比較中剔除了。所需配對數由 Connor 的公式給出:[1.96√ψ + 0.84√(ψ − δ²)]² ÷ δ²,其中 ψ 是發生翻轉的 prompt 占比。7 要偵測 10 個百分點的淨變化、且 20% 會翻轉,大約需要 155 個 prompt 配對,也就是 310 次觀測,而非配對設計要 706 次。這份節省來自穩定性:在答案最不易變的引擎上最大,在每次執行之間大幅重擲的引擎上最小,見AI 答案為何變化

它在哪裡失效

這個計算在什麼時候就不成立了?

公式底下壓著三條假設,而 AI 能見度測量把這三條都朝著讓數字更好看的方向違反了。第一條是常態近似,它在比率接近 0 或 1 時很不穩定:Brown、Cai 與 DasGupta 指出,它在那裡的覆蓋率很差,而且不會隨 n 增大而平滑改善。8 如果你只在 4% 的答案裡被點名,這個公式報出的樣本量就偏樂觀;請改用 Wilson 區間或 bootstrap 區間,這正是 2026 年 3 月那篇 AI 能見度測量的統計學處理所建議的,該文發現引用計數呈冪律形狀,且整個高頻被引集合內部的排名都不穩定。1

第二條是獨立性。在幾分鐘內成批打出去的執行不是全新的抽樣:它們碰到的是同一個索引狀態、同一份快取、同一個模型檢查點,所以請把執行分散到整個週期。只要執行在時間上叢集,有效樣本量就小於名義樣本量;而目前沒有針對 AI 能見度面板的設計效應估計,所以沒人能告訴你小多少。

第三條是引擎在你兩次測量之間沒有變化。這一條經常被違反,也是後果最嚴重的一條:它一旦失效,你測的就是平台而不是你的工作。一項覆蓋 230,000 條 prompt、超過 1 億條引用、採集於 2025 年 7 月中至 10 月中的三個月商業研究記錄到,某個助手對某個大型討論平台的引用率在六週內從約占回答的 60% 掉到約 10%。5 2026 年那篇批判性綜述把「商業引擎彼此不同且隨時間變化」評為置信度。2 應對辦法是留一組你從不針對性優化的對照組 prompt,好讓平台漂移與你的效應分開顯現;怎麼建,見可辯護的報告那一篇。

本文誠實的邊界

這裡的每一個數字都是下界,而不是估計值。公式假設的是從一個靜止系統中抽取的獨立樣本,而 AI 答案引擎兩樣都不提供:一天之內的多次執行彼此相關,引擎也在測量底下不聲不響地變化。這兩處違反都朝同一個方向推,所以真實需求量大於表裡的數字,而沒人說得出大多少,因為從來沒有人發表過針對 prompt 面板的設計效應估計。請把 10 個百分點需要 353 次觀測當作下限,並對任何報出更小數字的人保持懷疑,包括我們自己。

產品派得上用場的地方,和派不上的地方

整個計算就是四次乘法和一次除法,一張試算表就能做。給一次測試定樣本量不需要任何軟體,而已經太小的測試,也沒有任何軟體能把它的檢定力提上來。Bavior 按排程把一組固定的 prompt 面板打到五個引擎上,並記錄每一次執行,包括什麼都沒發生的那些,那正是這個計算要消耗的原料。它不做的是:替你跑顯著性檢定、替你決定對照組,或由引用預測流量與收入;該領域自己的綜述把最後這條關聯評為極低置信度。2 免費 AI 能見度檢測免費 GEO 健檢不需要付費方案;付費方案為按月付費每月 $99 起,或按年付費每月 $79.17(截至 2026 年 8 月 29 日)。

出處,全部核查於 2026 年 8 月 30 日
  1. Sielinski,《Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement》,2026 年 3 月,arXiv:2603.08924(預印本);建議以 bootstrap 區間報告引用份額估計:arxiv.org/abs/2603.08924
  2. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(綜述預印本);置信度表,內含那條被駁回的一般性主張,以及被評為高置信度的「商業引擎彼此不同且隨時間變化」:arxiv.org/abs/2607.14035
  3. Grossman 等,《How Generative AI Disrupts Search》,SIGIR 2026,arXiv:2604.27790;11,500 條查詢;論文寫明 Google 自然結果、AI Overviews 與 Gemini 三者來源之間的 Jaccard 相似度「介於 0.11 與 0.18 之間」,摘要則概括為低於 0.2:arxiv.org/abs/2604.27790
  4. Aggarwal 等,《GEO: Generative Engine Optimization》,KDD ’24;那個 40% 數字的來源,其性質是固定上下文內某個位置加權指標上的相對最大值:arxiv.org/abs/2311.09735
  5. 某引用研究,2025 年 11 月 10 日發布:230,000 條 prompt、超過 1 億條引用,採集於 2025 年 7 月 14 日至 10 月 12 日;某助手對某個大型討論平台的引用率在六週內從占回答的約 60% 降至約 10%。廠商發布,故按本課程規則只描述、不連結。
  6. Casagrande、Pike、Smith,《An Improved Approximate Formula for Calculating Sample Sizes for Comparing Two Binomial Distributions》,Biometrics 34(3):483,1978;連續性校正版本:doi.org/10.2307/2530613
  7. Connor,《Sample Size for Testing Differences in Proportions for the Paired-Sample Design》,Biometrics 43(1):207,1987;配對設計的公式:doi.org/10.2307/2531961
  8. Brown、Cai、DasGupta,《Interval Estimation for a Binomial Proportion》,Statistical Science 16(2),2001;覆蓋率在接近 0 與 1 處很不穩定:doi.org/10.1214/ss/1009213286
  9. Gelman、Carlin,《Beyond Power Calculations: Assessing Type S (Sign) and Type M (Magnitude) Errors》,Perspectives on Psychological Science 9(6):641–651,2014;誇大比:doi.org/10.1177/1745691614551642
  10. Button 等,《Power failure: why small sample size undermines the reliability of neuroscience》,Nature Reviews Neuroscience 14(5):365–376,2013;49 項統合分析、730 項研究的檢定力中位數為 21%:doi.org/10.1038/nrn3475
常見問題

你想知道的,都在這裡。

要證明我的 GEO 工作起了作用,需要多少次觀測?

這完全取決於你想證明的差異有多大,而且兩者是平方關係。從 30% 的起始比率出發,偵測 20 個百分點的變化約需每週期 91 次觀測,10 個百分點約 353 次,5 個百分點約 1,372 次,2 個百分點約 8,400 次,按引擎計,取檢定力 80%、雙側 5% 顯著水準。一次觀測是一條 prompt 在一個引擎上執行一次,所以 60 條 prompt 執行六次就是 360 次。請先決定多大的變化才會改變一個投入決策,再按那個幅度去定樣本量,而不是先收資料、事後再問它能支撐什麼。

我能不能就按週匯報 AI 能見度,同時註明它有噪聲?

你可以把它當作一項運營檢查按週匯報,但不該在上面畫一根趨勢箭頭。每個引擎每週約 200 次觀測時,從 30% 的基線出發,能與噪聲區分開的最小變化約為 13 到 14 個百分點,所以你看到的幾乎每一次週環比變動都是波動。可行的安排是:按週執行,按週閱讀答案以取得定性訊號,例如冒出來的新競品、或關於你產品的新錯誤陳述,而把數字按月發布;同樣的執行聚合四週,可偵測效應會降到約 6.6 個百分點。

配對的前後設計真的需要更少資料嗎?

是的,而且當你的面板夠穩定時,節省幅度很大。配對設計在前後兩次使用完全相同的 prompt,並用 McNemar 檢定逐條比較;它只計入狀態發生改變的那些 prompt,因此 prompt 之間的變異從比較中被消掉了。要偵測 10 個百分點的淨變化,且兩次測量之間有 20% 的 prompt 翻轉,你大約需要 155 個 prompt 配對,總計 310 次觀測,而非配對設計需要 706 次。這份節省來自穩定性,所以在答案於多次執行之間大幅重擲的引擎上會縮小;而如果你在兩次測量之間改了 prompt 清單,它會完全消失。

我的比率只有 4%,這個公式還適用嗎?

不太可靠。在接近 0 或 1 的區間,它背後的常態近似很不穩定,覆蓋率很差,它給出的樣本量會偏樂觀。在那些比率下請改用 Wilson 區間或 bootstrap,這也是 2026 年 3 月那篇 AI 能見度測量的統計學處理所建議的,該文發現引用計數呈冪律形狀,且整個高頻被引集合內部的排名都不穩定。對一個處在 4% 的品牌來說,實際後果是幾乎沒有任何東西能在週與週之間被偵測到;一份誠實的報告會直說這一點,而不是在這麼小的基數上展示一個百分比變化。

Bavior 編輯部

負責研究與維護 Bavior 關於 Reddit 行銷和 AI 搜尋可見度的所有內容。文中每一個數字都註明了來源出處與查證日期,所有外部連結均非聯盟推廣連結。

發現數字有誤?告訴我們,我們會重新查證:support@bavior.com

先把樣本量定好,再去跑。
這樣得到的數字才算數。

免費試用