理由はプロジェクト管理の慣習ではありません。あなたが何も触らないときに測定がどう動くか、それが理由です。2026年の批判的サーベイは、再現性の証拠を一か所にまとめています。4,706件のクエリ監査が査読を経ている Kirsten らは、temperature をゼロにして実行を繰り返すと判定の9〜28%が変わることを見つけました。2 Schulte らは、小規模なスイスのクエリ集合について4つのエンジンを45日間観察し、日次の出典レベルの Jaccard が0.34〜0.42であったと記録しています。1
この2つを並べて読んでください。ある日、エンジンがあなたのプロンプト集合に対して引用する出典のかなりの部分は、前日とは違います。あなたの側では何も変わっていないのにです。介入はこれを上回らなければなりません。ベースラインが1回の読み取りではなく分布である理由もそこにあります。1つのプロンプトの1回の実行が語るのは、エンジンについてはわずかで、それを実行した1分間についてはたくさんです。
使える幅を買うのにプロンプトと実行回数がどれだけ要るかはパネルの規模で、あるパネル規模が何を検出でき何を検出できないかは統計的検出力で扱っています。ここでは繰り返しません。本記事が取るのは結論だけです。報告の単位はパネルであり、個々のプロンプトは決して報告の単位になりません。
カレンダーへの帰結は、その期限を決めた人にはっきり言っておく価値があります。90日以内なら、信頼できるベースラインを確立し、修正をリリースし、パネルを1回読み直すことはできます。しかし、特定のコンテンツ変更が特定の動きを引き起こしたと証明することまではできません。ドリフトする計測器に対する1回の前後比較では、その重さを支えられないからです。それを言うなら、第12週よりも第1週のほうがはるかに良いタイミングです。