이유는 프로젝트 관리 관행이 아닙니다. 당신이 아무것도 건드리지 않을 때 측정이 어떻게 움직이는지가 이유입니다. 2026년 비판적 서베이가 재현성 근거를 한곳에 모아 놓았습니다. 4,706건 쿼리 감사가 동료 심사를 거친 Kirsten 등은, temperature를 0으로 두고 실행을 반복하면 판정의 9~28%가 바뀐다는 것을 발견했습니다.2 Schulte 등은 작은 스위스 쿼리 집합에 대해 네 개 엔진을 45일간 관찰해, 일별 출처 수준 Jaccard가 0.34에서 0.42 사이임을 기록했습니다.1
둘을 같이 읽으십시오. 어느 날이든 엔진이 당신의 프롬프트 집합에 대해 인용하는 출처의 상당 부분은 어제와 다릅니다. 당신 쪽에서는 아무것도 바뀌지 않았는데도 그렇습니다. 개입이 이겨야 하는 것이 바로 이것이고, 베이스라인이 한 번의 판독이 아니라 분포인 이유도 이것입니다. 프롬프트 하나를 한 번 실행한 결과는 엔진에 대해서는 거의 말해주지 않고, 그것을 실행한 그 1분에 대해서는 많이 말해줍니다.
쓸 만한 구간을 얻으려면 프롬프트와 실행이 얼마나 필요한지는 패널 규모에서, 어떤 패널 규모가 무엇을 감지할 수 있고 없는지는 통계적 검정력에서 다룹니다. 여기서는 반복하지 않습니다. 이 글은 결론만 가져옵니다. 보고 단위는 패널이고, 개별 프롬프트는 결코 보고 단위가 아닙니다.
일정에 대한 결과는 마감을 정한 사람에게 소리 내어 말할 가치가 있습니다. 90일 안에 신뢰할 만한 베이스라인을 세우고, 수정을 배포하고, 패널을 한 번 다시 읽을 수 있습니다. 하지만 특정 콘텐츠 변경이 특정 움직임을 일으켰다는 것까지 증명할 수는 없습니다. 표류하는 계측기를 상대로 한 번의 전후 비교는 그 무게를 감당하지 못하기 때문입니다. 그 말을 하기에는 12주차보다 1주차가 훨씬 나은 시점입니다.