平均がシグナルを壊すのは、クラスごとに基準率が大きく違うからです。ブレンドした数字は、あなたの可視性の性質であると同時に、パネル構成の性質でもあります。40件のパネルで考えます:カテゴリ定義が12件で名指しされる割合は70%、候補リストが10件で15%、比較が8件で30%、適合性が4件で25%、異論が3件で10%、ハウツーが3件で45%。ブレンドは37.4%です。ここにすでに勝てているカテゴリ定義のプロンプトを5件足し、他は何も変えなければ、報告される数字は41.0%になります。3.6ポイントの上昇を生んだのは、編集上の判断です。
2つ目の理由は、勝ちが各クラスで同じ出来事ではないことです。候補リストのプロンプトでは、リストのどこかに載っていることが結果のすべてです。比較のプロンプトでは、名前の隣の一文が間違っていれば、載っていること自体に価値はありません。カテゴリ定義のプロンプトでは、隣接するカテゴリではなく正しいカテゴリに入ることが勝ちです。出現率1つでは、2つのクラスには正しい問いを、4つのクラスには誤った問いを立てることになります。
3つ目の理由は、クラスごとに答えを支える情報源の母集団が違い、したがって反応する作業も違うことです。カテゴリ定義とハウツーの回答は企業が自分で書けるページに寄りかかり、候補リストと異論の回答は書けないページに寄りかかります。数字が1つだと、何かが動いたことは分かっても、どのチームがそれを動かせたのかは分かりません。パネルを作るのはプロンプトリサーチのステージで、この記事はその各行に貼るタグの話です。