평균이 신호를 무너뜨리는 이유는 클래스마다 기저 비율이 크게 다르기 때문입니다. 그래서 혼합값은 여러분의 가시성만큼이나 패널 구성의 속성이기도 합니다. 40개짜리 패널로 계산해 보십시오: 카테고리 정의 12개에서 이름이 불리는 비율은 70%, 후보 목록 10개는 15%, 비교 8개는 30%, 적합성 4개는 25%, 반론 3개는 10%, 하우투 3개는 45%입니다. 혼합값은 37.4%입니다. 여기에 이미 이기고 있는 카테고리 정의 프롬프트를 다섯 개 더하고 다른 것은 아무것도 바꾸지 않으면, 같은 패널이 41.0%를 보고합니다. 3.6포인트의 상승을 만든 것은 편집상의 결정입니다.
두 번째 이유는 승리가 각 클래스에서 같은 사건이 아니라는 점입니다. 후보 목록 프롬프트에서는 목록 어디든 등장하는 것이 결과의 전부입니다. 비교 프롬프트에서는 이름 옆의 문장이 틀렸다면 등장 자체는 아무 가치가 없습니다. 카테고리 정의 프롬프트에서는 이웃한 카테고리가 아니라 올바른 카테고리에 들어가는 것이 승리입니다. 출현율 하나는 두 클래스에는 올바른 질문을, 네 클래스에는 잘못된 질문을 던집니다.
세 번째 이유는 클래스마다 답변을 뒷받침하는 출처 모집단이 달라서 반응하는 작업도 다르다는 점입니다. 카테고리 정의와 하우투의 답변은 회사가 직접 쓸 수 있는 페이지에 기대고, 후보 목록과 반론의 답변은 쓸 수 없는 페이지에 기댑니다. 숫자 하나는 무언가가 움직였다고만 말할 뿐, 어느 팀이 그것을 움직일 수 있었는지는 말하지 않습니다. 패널을 만드는 것은 프롬프트 리서치 단계이고, 이 글은 그 각 행에 붙이는 태그에 관한 것입니다.