ホーム/GEO を学ぶ/統計的検出力
AI可視性の測定 · 計算

前後比較には、どれだけの統計的検出力が必要か?

あなたの前後比較に意味があるかどうかは、1本の式が決めます。しかもその式は、手計算で確かめられるほど短いものです。このページの数字はすべてそこから導かれます。週次レポートについての、あまり気持ちのよくない結論も含めてです。

このページの内容
この記事をシェア
X でシェア LinkedIn でシェア
短い答え

前後比較には、あなたが実際に動く最小の変化を検出できるだけの観測数が必要です。その件数は2標本比率のサンプルサイズの式が教えてくれます。n = (1.96 + 0.84)² × [p₁(1−p₁) + p₂(1−p₂)] ÷ δ²、検出力80%、両側5%有意水準です。30%のベースラインからなら、10ポイントの変化には1期あたり約353件、2ポイントには8,400件。ですからエンジンごとに観測200件の週次レポートで見分けられるのは、おおよそ13から14ポイントまでで、それより小さいものは見分けられません。検出力不足は、公表された研究の常態です。2013年のあるレビューは、730件の研究を含む49のメタ分析を対象に、その統計的検出力の中央値を21%としました。10

重要ポイント
  • 数えるのは観測数であって、プロンプトの本数ではありません。1観測は、1本のプロンプトを1つのエンジンで1回実行することです。ですからプロンプト60本を6回実行すれば360です。
  • 必要量は二乗で効きます。検出したい変化を半分にすると、データは4倍必要になります。「観測数 ≈ 3.5 ÷ δ²」なら、会議の場で確かめられる程度には合っています。
  • 週次の数字は、正直に言えばトレンド矢印を支えられません。公表は月次にし、パネルが安定しているならペアで設計し、決して手を入れないプロンプトを取り置いてください。そうすればエンジンのドリフトが、あなたの効果として読まれずに済みます。

前後比較のサンプルサイズの式とは?

2つの比率を比べるときは、ふつうの2標本比率の式を使います。このページの数字はすべてそこから出てきます。n = (zα/2 + zβ)² × [p₁(1−p₁) + p₂(1−p₂)] ÷ (p₂ − p₁)²。慣例的な設定、つまり両側5%有意水準なので zα/2 = 1.96、検出力80%なので zβ = 0.84 とすると、先頭の定数は 2.8² = 7.84 になります。

どの項も、データを集める前に自分で決めるものです。p₁ は出発点の比率で、当てずっぽうではなく実測します。p₂ は検出できるようにしたい比率で、これはビジネス上の判断です。次の四半期に何へ投資するかを変えるだけの、最小の改善幅のことです。δ = p₂ − p₁ はその差で、小数で書きます。そして n は各期間の観測数で、1観測は1本のプロンプトを1つのエンジンで1回実行することです。

1行だけ手で計算しておけば、残りは検算できます。30%から40%へ:0.30 × 0.70 = 0.21、これに 0.40 × 0.60 = 0.24 を足して合計 0.45、7.84 を掛けると 3.528、δ² = 0.01 で割ると 352.8 です。つまり前に353件、後に353件の観測です。

ここまでに AI 検索に固有のものは1つもありません。二値の結果を比べるときの算術そのものであり、上の版は流通している2つのうち小さいほうです。ほとんどの計算機が回すのは Casagrande、Pike、Smith の連続性補正版で、そちらはより大きい n を返します。ですからこのページの数字はすべて下限として読んでください。6 1つの比率の精度と、2つの比率の差の検出は別の計算です。前者に合わせて大きさを決めたパネルは、後者には決まって小さすぎます。精度に合わせたサイズ決めは、プロンプトリサーチのパネルの規模で扱っています。

数字

変化の大きさごとに、観測は何件必要か?

30%の開始比率から、エンジンごとに。20ポイントの変化なら1期あたり約91件、10ポイントなら353件、5ポイントなら1,372件、2ポイントなら8,400件です。真ん中の列は分散の項です。

検出したい変化p₁(1−p₁) + p₂(1−p₂)1期あたりの観測数それを満たすパネル
30% → 50%(20ポイント)0.460約91プロンプト20本 × 5回
30% → 40%(10ポイント)0.450約353プロンプト60本 × 6回
30% → 35%(5ポイント)0.438約1,372プロンプト60本 × 23回、週次では無理
30% → 32%(2ポイント)0.428約8,400まともなペースでは達成不能

個々の行よりも大事な性質が2つあります。1つ目。必要量は δ について二乗で効くので、検出したい効果を半分にするとデータは4倍必要になります。だからこそ、最初の行と最後の行のあいだの18ポイントが、約90倍という代償になります。そしてこれが、プログラムに払える報告のペースを決めます。

2つ目は、分散の項がほとんど動かないことです。表の全体で 0.428 から 0.460 までしか動かないので、変動のほぼすべては δ だけから来ます。おかげで、この範囲では誤差5%程度に収まる近道が使えます。観測数 ≈ 3.5 ÷ δ²、δ は小数です。

帰結

観測200件の週次レポートは何を検出できるか?

エンジンごとに観測200件を載せた週次レポートが検出できるのは、およそ13から14ポイントの変化です。近道を逆に回してみます。3.5 ÷ 200 = 0.0175、その平方根は 0.132。30%のベースラインから正確な式で解くと約13.5ポイントです。30%から44%への上昇は検出できるぎりぎりの縁にあり、30%から35%への上昇は見えません。ダッシュボードがどれだけ自信ありげに描いてもです。

導かれる結論は、あまり気持ちのよいものではありません。週次の GEO レポートは、正直に言えば大きな変動以外は何も検出できません。それより小さいものはすべて揺らぎです。それを前進として報告することが、4か月目に、誰も理由を言えないまま線が戻ったときに、プログラムが信用を失うやり方です。

同じ算術は、公表された事例研究の読み方も教えてくれます。サンプルサイズを手元に置いて読むことです。生成エンジン最適化でいちばん有名な主張、つまりGEO は可視性を 40% 高めるは、2026年の批判的サーベイに一般的な主張としては棄却と記載されています。その数字が、大本の論文における「特定の構成下で1つの指標に対する相対的な最大値」であり、その論文が測ったのは実際のエンジン上の可視性ではなく、固定された文脈の中の位置重み付き指標だったからです。24 ほとんどの事例研究は、もっと静かに失敗します。書き換えの後で可視性が 22% から 27% に上がったと誰かが報告したら、それぞれの数字の背後に観測が何件あるのかを尋ねてください。片側およそ1,400件を下回ると、その比較は効果とノイズを分けられません。これは不誠実なのではなく検出力不足であり、私たちが公表するものにも同じように当てはまります。

M型エラーとS型エラー

検出力不足の検定が出す有意な結果は、何を誇張するのか?

誇張されるのは、その検定自身の効果量です。しかもその倍率は事前に計算できます。検出力が低いとき、有意性の閾値を越えられるほど大きいのは、行きすぎた推定だけです。ですから有意性でふるいにかけること自体が、誇張をふるい分けることになります。Gelman と Carlin はこの歪みを誇張比と呼び、「効果の大きさがどれだけ過大評価されうるかの倍率」と定義したうえで、S型エラー、つまり有意な推定の符号が逆になっている確率と対にしています。9

実務での姿はこうです。13ポイントを検出できるだけの検出力しかない比較が、真の効果が4ポイントであるときにたまたま有意な結果を返した場面では、4よりはるかに大きい数字を報告します。これは検定の欠陥ではありません。ノイズの多い推定に有意性のフィルターをかければ、そうなるというだけです。そして、GEO プログラムの最初の四半期に、誰も再現できない数字がこれほど頻繁に出てくる理由でもあります。

これは例外的なケースではなく、公表された研究の常態です。この論点を確立した2013年のレビューは、730件の研究を含む49の神経科学メタ分析にわたる統計的検出力の中央値を21%としました。10 AI 可視性の事例研究について同等の監査は存在しませんし、その多くは1回きりの実行なので、もっと低いと考えておいてください。守り方は、もっと賢い検定ではありません。データを見る前に、自分が行動に移す効果の大きさを決めておくこと。そして最初の有意な結果は、発表すべき発見ではなく、走り直すべき仮説として扱うことです。

3つのレバー

実行を増やさずに検出力を買うには?

スケジュールに実行を1回も足さずに、比較が検出できる幅を上げるレバーが3つあります。期間を延ばす、プロンプト類型の中でまとめる、ペアで設計する、です。これらはパネルではなく比較そのものに効くので、プロンプトリサーチの「本数か回数か」の配分と重ねて使えます。

期間を延ばす。月次の比較は、すでに回している4週間分の実行をまとめます。ですから観測200件は800件になり、検出可能な効果は約13.5ポイントから約6.6ポイントまで下がります。交換レートに注意してください。データが4倍でも、買えるのは2倍の解像度だけです。必要量が二乗で効くからです。忍耐だけでは週次のペースは救えません。週次は報告の単位としては捨て、運用上のチェックとしてだけ残すことになります。

プロンプト類型の中でまとめる。単独のプロンプトではなく、類型ごとまとめて前後を比べてください。コンテンツの変更は、どのみち類型のレベルで現れるはずだからです。守るべき規律は、同じ類型の中でまとめ、決して類型をまたがないことです。類型は互いに独立に動くので、12ポイント伸びた類型を横ばいの4類型と混ぜると、本物の効果が検出不能なところまで薄まります。そのまとめ方は、検出力を買うどころか失わせています。エンジンをまたいでまとめるのは、もっと悪いことです。エンジンがリトリーバルする情報源は、ほとんど重ならないからです。3

ペアで設計する。前と後で同一のパネルを実行し、McNemar 検定でプロンプトごとに比べます。この検定は状態が変わったプロンプトだけを使うので、プロンプト間の分散が比較から落ちます。必要なペア数は Connor の式が与えます。[1.96√ψ + 0.84√(ψ − δ²)]² ÷ δ²、ψ は反転するプロンプトの割合です。7 20%が反転する状況で10ポイントの正味の変化を検出するなら、必要なのはプロンプトのペア約155組、観測にして310件で、ペアにしない設計の706件に対する数字です。この節約は安定性から来ます。答えが最も動かないエンジンで最大になり、実行のたびに大きく振り直されるエンジンで最小になります。詳しくはAIの答えが変わる理由をご覧ください。

どこで壊れるか

この計算は、いつ成り立たなくなるのか?

この式の下には3つの仮定が置かれていて、AI 可視性の測定はその3つとも、数字がよく見えるほうへ破ります。1つ目は正規近似で、0 や 1 に近い比率では不安定です。Brown、Cai、DasGupta は、そこではカバレッジが悪く、n が増えても滑らかには良くならないことを示しました。8 回答の 4% でしか名前が挙がらないなら、この式が示すサンプルサイズは楽観的です。Wilson 区間かブートストラップ区間を使ってください。2026年3月の AI 可視性測定の統計的な扱いも、引用数がべき乗則の形をしていて、頻繁に引用される集合の全体でランキングが不安定だと分かったうえで、そう推奨しています。1

2つ目は独立性です。数分のあいだに一括で打った実行は、新しい抽出ではありません。同じインデックス状態、同じキャッシュ、同じモデルのチェックポイントに当たります。ですから実行は期間全体に散らしてください。実行が時間的にクラスターになると、いつでも実効サンプルサイズは名目より小さくなります。そして AI 可視性のパネルについてデザイン効果の推定は存在しないので、どれだけ小さいのかは誰にも言えません。

3つ目は、2回の測定のあいだにエンジンが変わっていないことです。これは日常的に破られますし、影響がいちばん大きいものでもあります。これが崩れたとき、測っているのはあなたの仕事ではなくプラットフォームです。2025年7月中旬から10月中旬にかけて集められた、プロンプト230,000件と1億件を超える引用を対象とする3か月の商業調査は、あるアシスタントの、ある大規模ディスカッションプラットフォームに対する引用率が、6週間で回答のおよそ60%からおよそ10%まで落ちたことを記録しています。5 2026年の批判的サーベイは「商用エンジンは互いに異なり、時間とともに変化する」を高い確信度と評価しています。2 守り方は、決して手を入れないプロンプトのホールドアウトセットです。そうすればプラットフォームのドリフトが、あなたの効果とは別に見えます。作り方は説明できるレポートで扱っています。

この記事の正直な限界

ここにある数字はどれも、推定値ではなく下限です。この式は、止まっている系からの独立な抽出を仮定しますが、AI 回答エンジンはそのどちらも与えてくれません。1日のうちの実行は相関しますし、エンジンは測定の下で、告知なしに変わります。2つの違反はどちらも同じ向きに押すので、本当の必要量は表が言うより大きくなります。そしてどれだけ大きいのかは誰にも言えません。プロンプトパネルについてのデザイン効果の推定が存在しないからです。10ポイントの変化に観測353件という数字は下限として扱い、それより小さい数字を挙げる相手は、私たち自身も含めて疑ってください。

製品が役に立つ場面と、立たない場面

計算の全体は掛け算4回と割り算1回で、表計算シートで済みます。テストのサイズを決めるのにソフトウェアは要りませんし、すでに小さすぎるテストの検出力を上げられるソフトウェアもありません。Bavior は固定のプロンプトパネルを5つのエンジンに定期実行し、何も起きなかった回も含めてすべての実行を記録します。それがこの計算の原料です。やらないのは、有意性検定を回すこと、あなたのホールドアウトセットを決めること、引用からトラフィックや売上を予測することです。この分野自身のサーベイは、最後のつながりを非常に低い確信度と評価しています。2 無料 AI 可視性チェッカー無料 GEO 診断は有料プランなしで使えます。有料プランは月払いで月額 $99 から、年払いなら月額 $79.17 です(2026年8月29日時点)。

出典、すべて2026年8月30日に確認
  1. Sielinski「Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement」2026年3月、arXiv:2603.08924(プレプリント)。引用シェアの推定にはブートストラップ区間を推奨:arxiv.org/abs/2603.08924
  2. 「Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)」2026年7月15日、arXiv:2607.14035(サーベイのプレプリント)。棄却された一般的主張と、高い確信度と評価された「商用エンジンは互いに異なり、時間とともに変化する」を含む確信度表:arxiv.org/abs/2607.14035
  3. Grossman ら「How Generative AI Disrupts Search」SIGIR 2026、arXiv:2604.27790。クエリ11,500件。論文本文は Google の自然検索結果、AI Overviews、Gemini の情報源のあいだの Jaccard 類似度を「0.11 から 0.18 のあいだ」と報告し、要旨では 0.2 未満とまとめています:arxiv.org/abs/2604.27790
  4. Aggarwal ら「GEO: Generative Engine Optimization」KDD ’24。40% という数字の出どころ。固定された文脈の中の位置重み付き指標における相対的な最大値です:arxiv.org/abs/2311.09735
  5. 2025年11月10日公表の引用調査。プロンプト230,000件と1億件を超える引用、2025年7月14日から10月12日に収集。あるアシスタントの、ある大規模ディスカッションプラットフォームに対する引用率が、6週間で回答の約60%から約10%まで低下。ベンダー発表なので、本カリキュラムの規則に従い、リンクせず記述にとどめます。
  6. Casagrande、Pike、Smith「An Improved Approximate Formula for Calculating Sample Sizes for Comparing Two Binomial Distributions」Biometrics 34(3):483、1978。連続性補正版:doi.org/10.2307/2530613
  7. Connor「Sample Size for Testing Differences in Proportions for the Paired-Sample Design」Biometrics 43(1):207、1987。ペアデザインの式:doi.org/10.2307/2531961
  8. Brown、Cai、DasGupta「Interval Estimation for a Binomial Proportion」Statistical Science 16(2)、2001。カバレッジは0と1の近くで不安定:doi.org/10.1214/ss/1009213286
  9. Gelman、Carlin「Beyond Power Calculations: Assessing Type S (Sign) and Type M (Magnitude) Errors」Perspectives on Psychological Science 9(6):641–651、2014。誇張比:doi.org/10.1177/1745691614551642
  10. Button ら「Power failure: why small sample size undermines the reliability of neuroscience」Nature Reviews Neuroscience 14(5):365–376、2013。49のメタ分析、730件の研究にわたる検出力の中央値は21%:doi.org/10.1038/nrn3475
よくある質問

よく聞かれることを、まとめました。

自分の GEO の仕事が効いたと証明するには、観測が何件必要ですか?

どれだけ大きな差を証明したいかで完全に決まりますし、その関係は二乗です。30%の開始比率からなら、20ポイントの変化の検出には1期あたり約91件、10ポイントには約353件、5ポイントには約1,372件、2ポイントには約8,400件、いずれもエンジンごと、検出力80%、両側5%有意水準です。1観測は1本のプロンプトを1つのエンジンで1回実行することなので、プロンプト60本を6回実行すれば360です。まず、投資判断を変えるだけの最小の変化を決めてください。そのうえでテストの大きさをそこに合わせます。データを集めてから、それで何が言えるかを後で尋ねるのではありません。

AI 可視性を週次で報告して、ノイズが多いと注記するだけでは駄目ですか?

運用上のチェックとして週次で報告するのは構いませんが、そこにトレンド矢印を引くべきではありません。エンジンごとに週約200件の観測では、30%のベースラインからノイズと区別できる最小の変化は、おおよそ13から14ポイントです。ですから目にする前週比の動きは、ほとんどすべて揺らぎです。現実的な運びは、週次で実行し、週次で回答を読んで定性的なシグナル、たとえば新しく現れた競合や、自社製品についての新しい誤った記述を拾い、数字は月次で公表することです。同じ実行を4週分まとめれば、検出可能な効果は約6.6ポイントまで下がります。

ペアにした前後の設計は、本当にデータが少なくて済むのですか?

はい。しかもパネルが安定していれば、節約は大きくなります。ペアデザインは前と後で同一のプロンプトを実行し、McNemar 検定でプロンプトごとに比べます。この検定は状態が変わったプロンプトだけを数えるので、プロンプト間の分散が比較から落ちます。2回の測定のあいだに20%のプロンプトが反転する状況で10ポイントの正味の変化を検出するなら、必要なのはプロンプトのペア約155組、観測にして合計310件で、ペアにしない設計なら706件です。この節約は安定性から来るので、実行のたびに答えが大きく振り直されるエンジンでは小さくなりますし、2回の測定のあいだにプロンプト一覧を変えれば、まるごと消えます。

うちの比率は 4% です。この式はまだ使えますか?

確実には使えません。0 や 1 の近くでは、その背後にある正規近似が不安定で、カバレッジが悪く、示されるサンプルサイズは楽観的になります。そうした比率では、代わりに Wilson 区間かブートストラップを使ってください。2026年3月の AI 可視性測定の統計的な扱いも、引用数がべき乗則の形をしていて、頻繁に引用される集合の全体でランキングが不安定だと分かったうえで、そう推奨しています。4% にいるブランドにとっての実際的な帰結は、週ごとにはほとんど何も検出できないということです。正直なレポートは、それほど小さい母数の上でパーセント変化を見せるのではなく、そのことをそのまま書きます。

Bavior 編集部

Reddit マーケティングと AI 検索可視性に関する Bavior のコンテンツを調査・管理しているチームです。記事中のすべての数値には出典と確認日を明記しており、アフィリエイトリンクは一切使用していません。

数値に誤りを見つけたらお知らせください。再確認します: support@bavior.com

テストの大きさを決めてから、走らせましょう。
そうしてはじめて、数字に意味が出ます。

無料トライアルを開始