比較兩個比率用的是普通的兩比例公式,本頁的每一個數字都由它推出:n = (zα/2 + zβ)² × [p₁(1−p₁) + p₂(1−p₂)] ÷ (p₂ − p₁)²。在慣例設定下,也就是雙側 5% 顯著水準故 zα/2 = 1.96、檢定力 80% 故 zβ = 0.84,前面那個常數就是 2.8² = 7.84。
每一項都是你在收集任何資料之前就必須定下來的東西。p₁ 是你出發時的比率,要實測,不能猜。p₂ 是你希望自己有能力偵測到的比率,這是一個業務決定:能改變你下一季投什麼的那個最小改進幅度。δ = p₂ − p₁ 就是這個差值,以小數寫出。而 n 是每一個週期裡的觀測數,其中一次觀測是一條 prompt 在一個引擎上執行一次。
手算一行,其餘就都可核對了。從 30% 到 40%:0.30 × 0.70 = 0.21,加上 0.40 × 0.60 = 0.24,兩者之和 0.45,乘以 7.84 得 3.528,再除以 δ² = 0.01,得 352.8。也就是前期 353 次觀測、後期 353 次。
這一切都不是 AI 搜尋特有的:它是任何二值結果比較都適用的算術,而上面這個版本是流通中的兩個裡較小的那一個。多數計算器跑的是 Casagrande、Pike 與 Smith 的連續性校正公式,它給出的 n 更大,所以請把本頁每一個數字都讀作下限。6 「一個比率的精度」和「兩個比率之差的可偵測性」是兩種不同的計算,按前者定尺寸的面板用在後者上往往太小;按精度定尺寸屬於 prompt 調研的面板規模那一篇。