取平均會摧毀訊號,因為這幾類的基準率差距很大,於是綜合數字既是你能見度的屬性,也同樣是面板構成的屬性。拿一個 40 條的面板來算:12 條品類定義類,你被點名的比例是 70%;10 條候選清單類,15%;8 條對比類,30%;4 條適配類,25%;3 條異議類,10%;3 條操作指南類,45%。綜合數字是 37.4%。再加五條你本來就贏的品類定義類 prompt,其他什麼都不動,同一個面板報出來就是 41.0%:這 3.6 個百分點的上升,是一個編輯決定製造出來的。
第二個理由是,「贏」在每一類裡並不是同一件事。在候選清單類 prompt 上,出現在名單的任何位置就是全部結果;在對比類 prompt 上,如果你名字旁邊那句話是錯的,出現本身一文不值;在品類定義類 prompt 上,贏是被歸進正確的品類,而不是相鄰的那一個。單一的出現率,對兩類問對了問題,對另外四類問錯了問題。
第三個理由是,這幾類是從不同的來源群體裡被回答的,因此它們回應的是不同的工作:品類定義類和操作指南類的答案倚賴一家公司寫得出來的頁面,候選清單類和異議類的答案倚賴它寫不出來的頁面。一個數字只會告訴你有東西動了,卻不會告訴你哪個團隊本來動得了它。prompt 調研階段負責把面板建起來,本文講的是面板每一行上貼的那個標籤。