찾고 있는 것의 크기부터 봅시다. C-SEO Bench는 NeurIPS 2025 Datasets and Benchmarks Track에서 발표됐고, 6개 도메인과 1.9k건이 넘는 쿼리에 걸쳐 총 열 가지 콘텐츠 방법을 돌렸습니다. 소매 열에서 열 가지 중 가장 강한 방법은 대상 문서를 0.36 순위만큼 움직였고 가장 약한 것은 −0.07이었습니다. 반면 그 문서를 모델 컨텍스트의 맨 앞에 놓는 것, 즉 순위가 하는 일의 값어치는 2.77이었습니다.1 순위 3분의 1은 단지 검출하기 어려운 정도가 아닙니다. 월요일에 여러분이 할 일을 바꾸기에는 너무 작습니다.
계기도 함께 움직입니다. 온도를 제어할 수 있는 환경에서는 온도 0으로 반복 실행할 때 4,706건의 쿼리에 걸쳐 판단의 9–28%가 바뀝니다.4 같은 질문을 두 번 하면 그것은 같은 실험이 아닙니다. 그 흔들림보다 작은 효과는 구조상 보이지 않습니다.
그리고 모집단이 있습니다. C-SEO Bench는 그 이동이 “양의 방향과 음의 방향 모두로 나타나며 서로 부분적으로 상쇄된다”고 보고합니다. 소매에서 가장 강한 방법은 26.2%의 사례에서 도움이 됐고 12.8%의 사례에서 해가 됐으며, 그래서 “전체 평균 효과는 0에 가깝지만 분산이 크다”는 것입니다.1 54개 사례 중 3개가 Holm-Bonferroni 보정 이후에도 유의미하게 긍정적이었으므로, 그 셋은 여러 방법을 한꺼번에 검정해서 생긴 허상이 아닙니다.1