ホーム/GEO を学ぶ/AIの答えが変わる理由
AI検索の仕組み · トピック

同じ質問を同じように2回実行しただけで、AIの答えが変わるのはなぜか。

1時間後に同じエンジンで同じプロンプトを繰り返すと、返ってくる情報源の組み合わせは変わります。これは不具合ではなく、実測されたこのシステムの挙動です。そして、自社の可視性について何を証拠と見なせるかは、これで決まります。

このページの内容
この記事をシェア
X でシェア LinkedIn でシェア
短い答え

AIの答えが同一の実行間で変わるのは、パイプラインのいくつかの段階が計算ではなくサンプリングされているからであり、その足元のインデックスも動き続けているからです。temperature が支配するのはその段階のうち最後の1つだけなので、0に設定してもシステムは再現可能になりません。4つのエンジンで45日間、Schulte らは1つのクエリが返す情報源について、日次の情報源レベルの Jaccard を 0.34–0.42 と測定しました。また 4,706 件のクエリを対象とする査読済みの監査は、temperature ゼロでの繰り返し実行でも判定の 9–28% が変わることを見つけました。いずれも2026年の批判的サーベイが伝えているものです。1

重要ポイント
  • 2回の実行の間で変わるものは4つあります。クエリのファンアウト、生きたインデックス、コンテキストの打ち切り線での再ランキング、そして生成です。temperature が触れるのは最後の1つだけです。
  • Jaccard は共通部分を和集合で割った値であって、引用された URL のうち引き継がれた割合ではありません。実測値 0.34–0.42 では、もう一度実行すれば、1回目には出てこなかった情報源が確実に返ってきます。
  • スクリーンショット1枚は1回の抽出です。割合はエンジンごとに、実行回数を横に添えて報告してください。同じ1社の中でさえ、エンジン同士は Jaccard 0.11–0.18 でしか一致しないからです。
仕組み

AIの回答エンジンの内部で、正確には何がランダムなのか

同じプロンプトの2回の実行の間では、少なくとも4つの別々のものが変わります。そのうち言語モデルのサンプリング temperature は1つだけです。AI検索の仕組みのステージで説明したパイプラインを順にたどると、1つ目はクエリの拡張です。Google は、AI Overviews と AI Mode が「回答を作成するために…『クエリのファンアウト』という手法を使うことがあります」と文書に記しており、サブトピックとデータソースをまたいで複数の関連検索を発行します。3 これらのサブクエリは調べて取り出すものではなく生成されるものなので、ランキングが起きる前の段階で、サブクエリの組み合わせが違えば候補プールも違ってきます。

2つ目はリトリーバルそのものです。生成された各サブクエリが当たるのは、継続的に再クロールされ、複数のマシンにシャーディングされ、新鮮さとパーソナライズのロジックの影響を受ける、生きたインデックスです。3つ目は選択です。候補は統合され、重複が除かれ、再ランキングされ、コンテキストの予算に収まるまで切り詰められます。打ち切り線のすぐ近くにある僅差は、実行ごとに違う決着をします。4つ目は生成で、選ばれた情報源のどれをどの文に実際に結びつけるかをモデルが決めます。ある情報源がリトリーバルされ、読まれ、それでも引用されないことがあります。

この4つのうち2つは、あなたが制御できるものすべての上流にあります。だから temperature を0にしてもシステムは決定論的になりません。2026年の批判的サーベイははっきりこう述べています。報告された temperature ゼロは「インデックスも、リトリーバルも、外部サービスのバージョンも固定しない」。1

大きさ

同一の2回の実行は、数字でどれだけ違うのか

ある日の情報源と次の日の情報源の重なりは Jaccard で 0.34–0.42 です。Schulte らが4つのエンジンで45日間、小規模なスイスのクエリ集合を対象に測定した値です。

Jaccard 類似度は、2つの集合の共通部分をその和集合で割った値です。情報源の集合が完全に同じなら 1.0、まったく共通しなければ 0 になります。繰り返された情報源の割合ではありません。

0.34–0.42

繰り返し実行の間の重なり

商用エンジンで1つのクエリが返す情報源の、日次の情報源レベルの Jaccard 重なり。4つのエンジンで45日間の測定で、2026年の批判的サーベイが伝えています。

9–28%

繰り返した判定の変化

4,706 件のクエリを対象とする査読済みの監査で、temperature ゼロでも繰り返した判定がひっくり返る割合。生成ステップの決定性は、答えの決定性を買ってくれません。

power law

引用分布の形

ドメイン横断の引用回数はべき乗則に従い、ばらつきが大きいものです。ごく少数のドメインは常に引用され、非常に長い裾は予測できない形で引用されます。

Jaccard 0.38 は、例で見たほうが体感しやすい数字です。あるエンジンが1つの回答につき8件の情報源を引用し、2回の実行が 0.38 で重なるなら、2回を合わせた和集合はおよそ11件の異なる情報源で、8件のうちおよそ5件が繰り返されます。3回目を実行すれば、まだ見ていない情報源に出会います。あなたのページは何も変わっていません。変わったのは標本です。

2026年3月の統計フレームワークは、多くの人が飛ばしてしまう知見を加えています。頻繁に引用される集合の内部でも順位は不安定で、それは上位だけでなく全体にわたっており、「ドメイン間の見かけ上の差の多くは、測定プロセスのノイズフロアの中に収まる」というものです。2 AI 可視性のレポートがこれほど自信をもって間違うのは、そのためです。一度だけ測られ、区間の付いていない実在の数字は、測定そのものの揺れと区別できません。

ノイズフロア

なぜ多くのブランドはノイズの上ではなく、ノイズの中にいるのか

べき乗則の分布が、ほとんど全員を平らな裾に置いてしまうからです。そこでは実行ごとの分散が、隣り合う相手との差より大きくなります。あるドメインがプロンプト群の回答の 6% に現れ、競合が 9% に現れるとして、その3ポイントの差は、別の日の午後に同じプロンプト群を実行し直したときに見えるばらつきより小さいのです。2026年3月のブートストラップ区間が実在のドメインで示しているのはこれです。その程度の差はノイズフロアの中に収まります。2

なぜそうなるかの計算に議論の余地はなく、研究も必要ありません。n 回の独立した実行で測った割合について、値が 50% 付近にあるとき、95% Wilson 区間の半幅はおよそ 1.96 を「n に 3.84 を足した値の平方根の2倍」で割った値になります。実行5回でおよそ ±33 ポイント、10回でおよそ ±26、30回でおよそ ±17、100回でおよそ ±9.6 です。こうした測定値を2つ比べるとき、今月と先月、あるいは自社と競合を比べるときには、2つの区間が重ならないことが必要で、そのために標本サイズがさらに約 40% 増えます。これは二項分布の計算であって、どの論文の知見でもありません。そして、5回の実行によるチェックでは、途方もなく大きな変化より小さいものは何も検出できない理由でもあります。

ここから、現実的な予算で何が検出できるかの序列が出てきます。「一部の回答には出て、一部には出ない」なら数回の実行で足ります。「まったく出なかった状態から、普通に出る状態になった」なら数十回かかります。「競合に対してシェアを3ポイント伸ばした」は、小さなチームが実際に回すどんな標本サイズでも検出できません。

ドリフト

ウェブが変わったせいでも答えは変わるのか

はい。そしてそのドリフトは実行ごとのランダム性とは別物で、より大きく、より遅いので、結果と取り違えやすいものです。あなたが取るどの測定の下でも、3つの別々の時計が動いています。ページが公開され、更新され、削除されるのでインデックスが変わります。モデルとリトリーバルのスタックが、たいてい告知なしに入れ替えられるのでエンジンが変わります。そしてクロールの層も変わります。Cloudflare の2025年の年次レビューは、年間を通じて AI ボットが HTML リクエストの 4.2% を占め、ユーザー起点のクロールは15倍以上に伸び、あるアシスタントのユーザー起点エージェントは年初の16倍でピークを迎えたと報告しています。4

エンジンのドリフトについて公表されたもっとも鋭い実例は、230,000 件のプロンプトと1億件を超える引用を対象とした3か月間の商用調査から来ています。2025年7月中旬から10月中旬にかけて行われたもので、あるアシスタントが1つの大規模ディスカッションプラットフォームを引用する率が、約6週間で回答のおよそ 60% からおよそ 10% まで落ちたことを記録しました。同じ期間に、ある百科事典の情報源も同じ桁で下落しています。5 それを起こすようなことをした発行者は1社もいません。その期間をまたいで前後比較を回したチームは、自社のコンテンツ施策による巨大な効果を測定し、その原因について間違えたことになります。

4つ目の、より静かな変化の源は情報源の可用性です。批判的サーベイが伝える2026年のプレプリントは、AI の回答ですでに引用されている URL の 27.1% が、アクセスできない、削除されている、あるいはテキストでないという理由でスクレイピングできなかったことを見つけました。6 あなたの2回の実行の間にログインの向こう側へ消えた情報源は、あなたの側で何も変わらないまま回答から抜け落ちます。

この記事の正直な限界

0.34–0.42 と 9–28% という数字は、エンジンと期間をまたいで複数の研究を集約したサーベイを経由してあなたに届いたものであり、あなたが使っている製品を対象とした1つの統制実験から来たものではありません。Jaccard の範囲は小規模なスイスのクエリ集合に由来します。自社の実行ごとの分散を公表しているエンジンはありません。プラスマイナス1割る根号 n の計算は独立した抽出を前提にしますが、1つの会話の中で繰り返す実行は独立ではありません。セッションの状態とキャッシュがそれらを相関させるので、同一セッションの実行から得た区間は楽観的です。27.1% という数字が測っているのは、第三者の研究者が引用された URL を取得できたかどうかであって、それを引用したエンジンが取得できたかどうかではありません。ここにあるすべての数字を、定数ではなく桁として扱ってください。

証拠の質

AIの回答のスクリーンショットは、なぜ証拠にならないのか

スクリーンショットは、ある分布からの1回の抽出です。その分布の広がりは、コンテンツチームが検出しようとするほとんどの効果より大きいのです。それでも3つの狭い用途には役立ちます。ある形の回答があり得ることの証明、訂正依頼のために具体的な事実誤認を記録すること、そして関係者にそのサーフェスがどう見えるかを示すことです。頻度、順位、時間による変化、競合についての主張は支えられません。

スクリーンショットが隠すもう1つの失敗の形があります。エンジンは、自分自身との違いより互いの違いのほうが大きいのです。SIGIR 2026 で発表された 11,500 件のクエリの研究は、Google のオーガニック結果、AI Overviews、Gemini が返す情報源の間で平均 Jaccard 類似度が 0.2 を下回り、2つずつの数値は 0.11 から 0.18 だったと報告しています。1社の3つのサーフェスでの話です。7 1つのサーフェスのスクリーンショットは他のサーフェスについて何も語らないので、「確認したが自社は出ていない」はたいてい、ある日の午後の1つのサーフェスについての発言です。どのサーフェスか、どのモードか、どのロケールか、検索が有効だったかどうかで答えは変わりますが、画像にはそのどれも写っていません。

方法

数字が意味を持つまでに、何回の実行が必要か

2026年のサーベイ自身の出発点は、プロンプトごとに7回から8回の繰り返しで、推定値まわりの区間が目の前の判断に十分なだけ狭くなるまで繰り返すというものです。1 1回の実行はサンプルサイズ1の標本であり、しかもあなたが見ようとしているほとんどの効果より広い分布から引かれています。

以下の手順は表計算だけで回せます。

回答を1件も見ないうちに、プロンプト群を文書で固定する

実際の買い手が打ちそうなプロンプトを20本から50本、書き出して凍結します。良い回答を見てからプロンプトを足すのは、測定がマーケティング素材に変わる道です。あなたについて何も返さないプロンプトは残しておいてください。それが分母です。

条件を毎回記録する

製品、モード、モデルのバージョン、日付、ロケール、そして検索が有効だったかどうか。2026年のサーベイは、この分野のどの研究でも報告すべき最低限としてまさにこれらを挙げています。これらの項目がない結果は、自分自身の過去の実行を含め、何とも比較できないからです。

実行はタブではなく、日をまたいで分散させる

1時間で30回の実行は、ほぼ1つのインデックス状態を再サンプリングしているだけです。3週間で30回の実行なら、本当に気にしているものを標本にできます。可能なら実行ごとに新しいセッションを使い、抽出を独立に近づけてください。

割合を区間つきで、エンジンごとに報告する

「あるエンジンでの40回の実行のうち11回で引用された」は、あなたが擁護できる文です。エンジンをまたいで混ぜた単一の可視性スコアはそうではありません。同じ1社の中でさえ、エンジンは Jaccard 0.11–0.18 でしか一致しないからです。

出現したかどうかだけでなく、引用された情報源を記録する

ある回答が引用した URL の一覧は、本文よりも安定していて、より行動につながります。そして、実際にどのサードパーティのページと競っているのかを教えてくれます。その大半はあなたのページではありません。

一度に1つだけ変え、それから妥当だと思うより長く待つ

再クロールと再インデックスの遅れがあるので、ページの編集とその効果は数週間離れます。そしてその数週間のエンジン側のドリフトは、あなたの編集より大きいことがあります。同じ週に出した2つの変更は、あとから区別できません。

出てくるのは範囲であって、順位ほど気持ちよくはありませんが、はるかに役に立ちます。AI可視性の測定のステージが、それを完全な測定計画に変えます。今日から身につける価値のある習慣はもっと小さなものです。AI 可視性の数字を書き留めるときは必ず、その横に何回の実行から出た数字かを書くこと。n のない数字は測定ではありません。

製品が役に立つ場面と、立たない場面

上に書いたことはすべて、表計算とカレンダーのリマインダー、そして同じプロンプト群を1か月回し続ける忍耐があれば実行できます。この特定の問題について Bavior がするのは、その忍耐という要件を取り除くことです。決まったプロンプト群を5つのエンジンに定期実行し、各回答がどの情報源を引用したかを記録するので、あなたが読むのはある日の午後の1枚のスクリーンショットではなく、多数の実行にまたがる分布になります。分散を減らすことはできず、個々の回答がなぜ変わったのかを説明することもできず、標本がノイズだと言っているときに3ポイントの動きが本物だと告げることは決してありません。無料 AI 可視性チェッカー無料 GEO 診断は有料プランなしで使えます。有料のトラッキングは月払いで月額 $99 から、年払いなら月額 $79.17 です(2026年8月29日時点)。

出典:すべて2026年8月29日に確認
  1. Martinez「Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)」、2026年7月15日、arXiv:2607.14035(サーベイのプレプリント)。§6.2:Schulte らの日次 Jaccard 0.34–0.42(4エンジン、45日間、小規模なスイスのクエリ集合)。Kirsten らの査読済み監査、4,706 件のクエリ、temperature ゼロでの繰り返し判定の変化 9–28%:arxiv.org/abs/2607.14035
  2. Sielinski「Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement」、2026年3月、arXiv:2603.08924(プレプリント。3プラットフォーム、9回の日次収集に10分間隔のサンプリングを追加):arxiv.org/abs/2603.08924
  3. Google Search Central「AI features and your website」(クエリのファンアウト。一次資料、最終更新2025年12月10日):developers.google.com/search/docs/appearance/ai-features
  4. Cloudflare「Radar 2025 Year in Review」(データ期間2025年1月1日–12月2日。AI ボットが HTML リクエストの 4.2%、ユーザー操作起点のクロールは 15× 超の伸び、あるエージェントは 16× でピーク):blog.cloudflare.com/radar-2025-year-in-review
  5. 3か月間の引用時系列。3つのアシスタント、230,000 件のプロンプト、1億件超の引用、2025年7月14日–10月12日。上で述べたディスカッションプラットフォームの急落。ベンダー公表のため、本カリキュラムの出典規則に従い、リンクせず説明のみ。
  6. Allaham と Diakopoulos、2026年のプレプリント(arXiv:2607.14035 §8.3 で伝えられている):AI の回答ですでに引用されている URL の 27.1% が、アクセス不能、削除済み、またはテキストでないという理由で研究者にはスクレイピングできなかった
  7. Grossman ら、SIGIR 2026、11,500 件のクエリ。要旨では平均 Jaccard が 0.2 未満、貢献一覧では2つずつで 0.11–0.18。Google のオーガニック結果、AI Overviews、Gemini が対象:arxiv.org/abs/2604.27790
よくある質問

よく聞かれることを、まとめました。

temperature を0に設定すれば、AIの答えは再現可能になりますか

いいえ。temperature が制御するのは生成ステップ内部のサンプリングだけで、生成は変動する少なくとも4つの段階の最後にあたります。クエリのファンアウトは毎回違うサブクエリの組み合わせを生成し、リトリーバルは継続的に変化する生きたインデックスに当たり、再ランキングは僅差の決着を実行ごとに変えます。2026年の批判的サーベイが伝える 4,706 件のクエリの査読済み監査は、まさに temperature を固定できるサーフェスにおいて、temperature ゼロでの繰り返し実行でも判定の 9–28% が変わることを見つけました。

自分のコンテンツ施策が効いたと言うには、何回の実行が必要ですか

多くのチームが実際に回す回数より多く、正直な答えは効果の大きさによります。50% 付近で測った割合について、95% Wilson 区間の半幅はおよそ 1.96 を「実行回数に 3.84 を足した値の平方根の2倍」で割った値です。実行10回でおよそ ±26 ポイント、30回で ±17、100回で ±9.6 です。前と後を比べるには2つの区間が互いに離れている必要があり、そのために標本サイズがさらに約 40% 増えます。これはありふれた二項分布の計算であって研究の知見ではなく、5回の抜き取り確認では、測らなくても明らかな変化しか検出できないということです。

毎回答えが変わるなら、AI 可視性を測る意味はありますか

あります。ただし順位ではなく分布として測ります。「8月にこのエンジンで40回の実行のうち11回引用された」は、判断を支えられる擁護可能な文です。「ChatGPT で3位」というものはそもそも存在しません。サンプリングのプログラムから出てくる有用なものは、エンジンごとに自社が出現した実行の割合、自社の代わりに引用され続けるサードパーティの情報源の一覧、そしてその両方が四半期で動いたかどうかです。3つとも分散に耐えます。単一の順位の主張は耐えません。

何も変えていないのに、AI 可視性が下がったのはなぜですか

もっとも可能性が高いのは、あなたではなくエンジンが変わったことです。230,000 件のプロンプトを対象とした3か月間の商用調査は、2025年のうち約6週間で、あるアシスタントが1つの大規模ディスカッションプラットフォームを引用する率が回答のおよそ 60% からおよそ 10% へ崩れたことを記録しました。関係する発行者は何もしていません。情報源の可用性も動きます。批判的サーベイが伝える2026年のプレプリントは、AI の回答ですでに引用されている URL の 27.1% がスクレイピングできなかったことを見つけました。これは第三者の研究者が取得できたかどうかを測る数字であって、引用したエンジンが取得できたかどうかではありません。自社のコンテンツを診断する前に、それらのプロンプトの情報源の構成全体が動いていないかを確認してください。

分散はどの AI エンジンでも同じですか

いいえ。しかもエンジンは、自分自身との食い違いよりも互いの食い違いのほうがはるかに大きいのです。SIGIR 2026 で発表された 11,500 件のクエリの研究は、Google のオーガニック結果、AI Overviews、Gemini の間で平均 Jaccard 類似度が 0.2 を下回り、2つずつの数値は 0.11 から 0.18 だったと報告しています。一方、1つのサーフェスの中の日ごとの重なりは 0.34–0.42 です。エンジン間の食い違いのほうが大きな効果なので、結果は1つの数字に平均するのではなく、エンジンごと、サーフェスごとに報告しなければなりません。

Bavior 編集部

Reddit マーケティングと AI 検索可視性に関する Bavior のコンテンツを調査・管理しているチームです。記事中のすべての数値には出典と確認日を明記しており、アフィリエイトリンクは一切使用していません。

数値に誤りを見つけたらお知らせください。再確認します: support@bavior.com

スクリーンショット1枚は、1回の抽出にすぎません。
これからは分布を読みましょう。

無料トライアルを開始