出现率是一个样本比例:每一次运行要么点了你的名,要么没有。每次运行都是一次伯努利抽样,其概率 p 观察不到,且属于「某条 prompt 在某个引擎上的某一周」;你能看到的,只是点了你名字的那部分运行的占比。本页所有区间都是 95% Wilson 得分区间,也就是 Brown、Cai 与 DasGupta 建议用来替代教科书正态近似的那一个。11 在 50% 出现率下,它的半宽是 1.96 除以「n 加 3.84 的平方根的两倍」,其中 n 是这个数字背后的观测次数。
有两个约定,能让它在你还没有任何数据时就可用。取 p = 0.5 来计算,因为 p(1−p) 在那里取到最大值,按最坏情况规划意味着你承诺过的区间绝不会比你实际拿到的更窄。另外,数的是观测而不是 prompt 条数:n 等于条数乘以运行次数,并且要按引擎分别计。
把它反过来用,就能直接给面板定规模。要达到半宽 w,你需要 n = 0.96/w² − 3.84 次观测:±10 个百分点约需 92 次,±7 约需 192 次,±5 约需 380 次。本页所有的 n 都是这笔算术,而不是研究结论,所以它们都没有标注到某篇论文;下面的出处,是给「算术在哪里失效」以及「引擎在底下移动了多少」用的。