平均会摧毁信号,因为这些类别的基础比率差别很大,于是综合数字既是你的可见性的属性,也是面板构成的属性。用一个合理的 40 条面板算一遍:12 条品类定义类,你被点名的比例是 70%;10 条候选清单类,15%;8 条对比类,30%;4 条适配类,25%;3 条异议类,10%;3 条操作指南类,45%。综合出现率是 37.4%。现在再加五条你本来就赢的品类定义类 prompt,别的什么都不动,同一个面板报出来就是 41.0%:这 3.6 个百分点的上升,完全是一个编辑决定制造出来的。
第二个理由是,“赢”在每一类里不是同一件事。在候选清单类上,出现在名单里的任何位置就是全部结果。在对比类上,如果你名字旁边那句话是错的,出现本身一文不值。在品类定义类上,赢是被归进正确的品类,而不是相邻的那个。一个单一的出现率,对六类中的两类问对了问题,对另外四类问错了。
第三个理由是,这些类别是从不同的来源群体里被回答的,因此它们响应的是不同的工作。品类定义类和操作指南类的答案,靠的是一家公司写得出来的页面;候选清单类和异议类的答案,靠的是它写不了的页面。把它们报成一个数字,只会告诉你“有东西动了”,却不告诉你哪个团队本来能推动它。提示词研究这一阶段 讲怎么把面板建起来;本文讲的是面板每一行上贴的那个标签。