比较两个比率所需的样本量,用的就是那个普通的两比例公式,而本页的每一个数字都由它推出:n = (zα/2 + zβ)² × [p₁(1−p₁) + p₂(1−p₂)] ÷ (p₂ − p₁)²。在惯例设定下,即双侧 5% 显著性水平故 zα/2 = 1.96、功效 80% 故 zβ = 0.84,前面那个常数就是 2.8² = 7.84。
每一项都对应一个你必须在收集数据之前就定下来的东西。p₁ 是你出发时的比率,要实测,不能拍脑袋。p₂ 是你希望自己有能力检测到的比率,它是一个业务决定而不是统计决定:它是“小到再小就不会改变你下季度投什么”的那个最小改进幅度。δ = p₂ − p₁ 是这个差值,以小数写出的百分点。而 n 是前后两个周期中每一个的观测数,其中一次观测是“一条 prompt 在一个引擎上跑一次”。
手算一行,其余就都可核对了。从 30% 到 40%:p₁(1−p₁) = 0.30 × 0.70 = 0.21;p₂(1−p₂) = 0.40 × 0.60 = 0.24;两者之和为 0.45;乘以 7.84 得 3.528;再除以 δ² = 0.10² = 0.01,得 352.8。也就是前期 353 次观测、后期 353 次。
这些都不是 AI 搜索特有的,也不是任何论文的发现:它是任何二值结果比较都适用的算术。而上面这个版本是流通中的两个里较小的那一个。Casagrande、Pike 与 Smith 的连续性校正公式(多数计算器跑的就是它)给出的 n 比上面这个朴素版本更大,所以请把本页每一个数字都读作下限。6 “一个比率的精度”和“两个比率之差的可检测性”是两个不同的计算,按前者定尺寸的面板用在后者上往往太小;前者属于提示词研究 的《多少条 prompt、跑多少次》。