ホーム/GEO を学ぶ/説明できるレポート
AI可視性の測定 · レポーティング

説明できるAI可視性レポートには何が入るのか?

どの数字にも観測数、日付範囲、パネルのバージョンが付いてきます。付いていなければ、その数字は何とも比較できません。あなたの仕事と、その下にあるプラットフォームのドリフトを分けるのがホールドアウトセットです。

このページの内容
この記事をシェア
X でシェア LinkedIn でシェア
短い答え

説明できるAI可視性レポートは、言及率と引用率をエンジンごとに出し、それぞれに区間を付け、それぞれに観測数、日付範囲、パネルのバージョンを刻みます。さらに、誰も手を加えていないプロンプトのホールドアウトセットを持ち、プラットフォームのドリフトをあなた自身の仕事から切り分けられる状態に保ちます。エンジンごとに報告するのは細かすぎるからではありません。11,500件のクエリを扱ったSIGIR 2026の研究は、Googleのオーガニック結果、AI Overviews、GeminiのあいだのURLレベルのJaccard類似度を0.11から0.18と測りました。つまり、ひとつの混合スコアは実在しないエンジンを説明しているのです。5

重要ポイント
  • どの数字にも4つの刻印が付いてきます。エンジン、観測数、日付範囲、パネルのバージョンです。1つでも欠けた数字は、先月の数字と比較できません。
  • パネルのクラス構成を映した10〜15個のプロンプトを凍結したホールドアウトが、あなたの効果とエンジンのドリフトを分けます。
  • ページに載せないもの:エンジンをまたいだ平均、最小検出可能効果より小さい変動に付けた矢印、引用から推定した売上。
出所

ページ上のどの数字にも何が付いてこなければならないのか?

どの数字にも4つのものが付いてきます。付いていなければ、その数字は何とも比較できません。どのエンジンから来たか、背後に何回の観測があるか、どの期間を対象にしているか、そしてそれを生んだプロンプトパネルのバージョンです。このうち1つを欠いた数字は測定ではありません。今月の値と先月の値が同じ計器から出たものかどうか、読み手には判断できないからです。

パネルのバージョンは、チームが飛ばしがちな項目であり、1年分の履歴を静かに無効にする項目でもあります。プロンプトを6つ足せば、すべての比率の分母が変わります。だから2つのバージョンをまたいだ29%から34%への上昇は、どの質問を投げたかが生んだ見かけ上の結果かもしれません。2部構成のバージョン番号を使い、すべての数字の横に印刷してください。マイナーの繰り上げは、プロンプトが何を尋ねているかを変えない文言修正です。これをまたぐ比較は脚注だけで足ります。メジャーの繰り上げは、プロンプトの追加、削除、範囲変更です。この場合は比較せず、ベースラインを取り直します。プロンプトの一覧はバージョン管理に置き、誰でも2つのバージョンをdiffできるようにしてください。

ここから運用ルールが1つ出てきます。測定したいコンテンツやオフサイトの施策と同じ期間に、パネルを変えてはいけません。やってしまえば、2つの原因は取り返しがつかないほど交絡します。静かな期間にパネルを変え、ベースラインを取り直し、それから動いてください。

区間も数字に付いてくるものです。2026年の批判的サーベイがGEO研究に求める最低限のチェックリストは、製品、モード、モデル、日付、ロケール、検索が有効だったかどうか、複数の時間帯での繰り返し実行、リトリーバルと生成を分けること、そしてヌルの結果を分母に残すことを求めています。1 その研究用チェックリストを満たす商用レポートとは、要するに社外の人間が検証できるレポートのことです。

対照

ホールドアウトセットとは何で、レポートになぜ必要なのか?

ホールドアウトセットとは、プロンプトパネルのうち、意図的に一切手を加えない部分です。そのためにコンテンツを書かず、そこを狙ったオフサイトの施策も打たず、数字が悪く見えても外しません。エンジン全体のドリフトが、あなたの仕事とは別に見えるように存在します。これがないと、ダッシュボード上で上昇とプラットフォームの更新は見分けがつきませんし、下落と運の悪い月も同じです。

作るのは一度、パネルを作るときだけです。10〜15個で十分ですが、パネルの残りのクラス構成を映していなければなりません。クラスによってドリフトの速さが違うので、定義型の質問だけで作ったホールドアウトは、比較型の質問に当たった変化を追えません。ほかのすべてと同じバージョン体系で凍結し、新しいメンバーがうっかり最適化してしまわないように印を付けてください。

差分の差分として読みます。あなたの効果は、おおよそ施策を打った組の変化からホールドアウトの変化を引いたものです。両方が8ポイント下がったなら、動いたのはエンジンであって、あなたは何も間違えていません。施策を打った組が9ポイント上がり、ホールドアウトが横ばいなら、証拠があります。この引き算こそが、前後比較の数字をあなた自身の仕事についての主張に変えます。

正直な限界が2つあります。12個ほどのプロンプトのホールドアウトは、それ自体が幅の広い区間を持ちます。だからその動きは、精密な補正ではなく方向として読んでください。ノイズのある数字からノイズのある数字を引いても、きれいな数字にはなりませんし、こうして合わせた比較にはどちらか一方だけより多くのデータが要ります(その計算は統計的検出力の記事にあります)。もう1つ、これが打ち消せるのは両方の組に等しく効いた変化だけです。モデルの入れ替えは捉えますが、あなたが手を入れていた質問を狙った競合のキャンペーンは捉えません。

ここまでのコストを払う理由は、プラットフォームのドリフトが大きいからです。2026年の批判的サーベイは「商用エンジンは互いに異なり、時間とともに変動する」を確信度と評価しています。1 あるベンダーの時系列がその大きさを具体的にします。2025年7月に採取された190万件のAI Overviewの引用と、2026年3月の863,000件のキーワード結果ページにわたる400万件の被引用URLのあいだで、被引用ページのうちオーガニック上位10位にも入っていた割合は、およそ76%からおよそ38%に下がりました。6 この期間をまたいでホールドアウトなしに前後比較を走らせたチームは、プラットフォームを測り、それを自分たちの成果として書いたことになります。

ページそのもの

何をページに載せ、何を載せないのか?

ページに載せるべきものが5つ、積極的に害になるものが5つあります。分かれ目は、パネルを回していない人からの追及にその項目が耐えるかどうかです。

ページに載せる

  • エンジンごとの言及率と引用率。それぞれに区間と観測数を添える
  • 施策を打った組をホールドアウトセットの隣に置き、ドリフトと効果が一目で分けられるようにする
  • プロンプトのクラス別の内訳。あるクラスの上昇と別のクラスの下落は合計では打ち消し合うため
  • パネル全体の被引用URLのランキング。競合もサードパーティもすべて含める
  • 回答の原文を2つか3つ。少なくとも1つは、あなたを誤って説明したもの

ページに載せない

  • エンジンをまたいで平均した単一の数字
  • 最小検出可能効果より小さい変動に付けた矢印
  • 図解ではなく証拠として差し出されたスクリーンショット
  • 引用に帰属させた推定セッション数やパイプライン
  • 自分が出てこなかったという理由で静かに落とされた実行

2つの項目は理由を言葉にしておく必要があります。誤りを含む回答の原文がページに載るのは、存在の有無を測る指標が、自信を持って誤ったあなたの製品説明を勝利として数えてしまうからで、しかもその基礎発生率は低くありません。2025年3月6日に公表されたTow Center for Digital Journalismの監査は、8つのエンジンにわたる1,600件のクエリを調べ、それらが「クエリの60パーセント超に誤った回答を返した」と報告しています。2 引用された一文は、どんなグラフよりも修正に予算を付けさせます。

売上の行をページから外すのは、掛けるべき係数が存在しないからです。この分野自身のサーベイは、引用スコアがクリック、コンバージョン、売上を予測するという主張を確信度非常に低いと評価しており、1 Pew Research Centerの2025年7月の閲覧調査では、AIの要約の中のリンクをクリックした訪問はおよそ1%でした。3 経営陣が商業的な言い方を必要とするなら、モデル化の仮定を口に出して述べ、それが仮定であると明示してください。グラフになった瞬間、それは測定結果として引用されます。

エンジンごとに

レポートはなぜエンジンをまたいで平均できないのか?

エンジンが見ているウェブが同じではないからです。SIGIR 2026の研究は、Googleのオーガニック検索、AI Overviews、Gemini Flash 2.5が11,500件のクエリに返したソースを比較し、URLレベルのJaccard類似度を、AI Overviewsとオーガニックのページのあいだで0.18、オーガニックとGeminiのあいだで0.16、2つのAIサーフェスのあいだで0.11と測りました。「クエリの部分集合がどれであれ、どの検索エンジンの組を比べても、取得されたリストは似ていない。3つともGoogleが開発したものであるにもかかわらず、である」5 1社から出た3つのサーフェスが、すでに一致していません。

そこで混合スコアは、読み手が必要とするものを隠します。あるエンジンで41%、別のエンジンで9%だとすると、平均の25%はどちらについても真ではありません。それが動くのは重み付けを変えたときであって、あなたの可視性が動いたときではありません。2026年の批判的サーベイも監査文献から同じ場所にたどり着き、商用エンジンには「ソースの重なりが少なく、実行ごとのばらつきが大きく、忠実性のギャップが解消されないまま残っている」と報告しています。1

代わりに小さな表を出してください。エンジンごとに1行、それぞれの観測数、区間、パネルのバージョンを添えます。経営陣が追跡する数字を1つ求めるなら、名前を挙げた単一のエンジンにして、なぜそのエンジンが商業的に重要なのかを述べてください。

頻度

レポートは実際どのくらいの頻度で出すべきか?

数字は月次で公表し、パネルは週次で回してください。この2つは別の仕事だからです。エンジンあたりおよそ200件の観測を持つ週次のパネルは、およそ13から14ポイントの動きしかノイズと区別できません。同じ実行を月次で集計すると、それがおよそ6.6ポイントまで下がります。そして現実の変化はほぼすべて、この2つの数字のあいだに収まります。

週次の読みは定性的で、本当に役に立ちます。比率ではなく回答を読み、3つを探してください。引用リストに新しく現れた競合やサードパーティのURL、先週にはなかったあなたの製品についての誤った記述、そしてAIの回答をまったく返さなくなったプロンプトです。どれも比率ではなく出来事なので、統計的検出力は要りません。記録して動いてください。計算は月次のページに取っておきます。

四半期ごとに、事業と突き合わせてパネルを読み直してください。プロンプトは古びます。一度も廃止しないパネルは、誰も尋ねない質問を測るようになっていきます。これはメジャーの繰り上げであり、ベースラインの取り直しでもあるので、予定に入れておいてください。

ヌル結果

何も動かなかったとき、レポートには何を書くのか?

「検出可能な変化なし」と書き、検出できたはずの変化の大きさを併記してください。「このエンジンでの言及率31%、観測200件、先月の29%から検出可能な変化なし。このパネルが検出できた最小の変化はおよそ13ポイント」と書けば、何が分かって何が分からなかったのかが読み手に正確に伝わります。「2ポイント上昇」は、偽りを伝えます。

ヌル結果が片付けられてしまわないよう守る習慣が2つあります。1つ、自分が出てこなかった回も含め、すべての実行を分母に残すこと。2026年の批判的サーベイのチェックリストがそれを求めていますし、空の実行をこっそり落とすことは、パネルがその持ち主であるチームにお世辞を言い始める最もよくある入口です。1 もう1つ、点推定ではなく区間を報告すること。2026年3月のAI可視性測定に関する統計的な論文は、引用回数がべき乗則の形をしており、順位が「サンプルをまたいで不安定であり、上位のドメインだけでなく、頻繁に引用されるドメイン集合の全体にわたってそうである」ことを見いだし、その不確実性をブートストラップ再標本抽出で報告しました。4 比率が非常に低い、または非常に高いところでは正規近似が劣化するので、正確区間かブートストラップ区間が誠実な計器です。ただしこの注意書きは通常の統計であって、この論文の発見ではありません。

ヌルはむしろ普通だと思ってください。NeurIPS 2025のC-SEO Benchは「現在のC-SEO手法の多くは、大部分が効果がないだけでなく、しばしば文書のランキングに悪影響を与える」と報告しています。7 それでも、動かなかった月が報告すべきことのない月であることはめったにありません。あなたの比率が動かなくても引用リストは変わっていますし、行動はそこにあります。誰のページが誰を置き換えたのか、自社のどのページが一度も出てこないのか、どの回答があなたについて事実でないことを言うようになったのか。比率が上がることに価値が依存するレポートは、いずれ比率を上げるために書かれるようになります。

この記事の正直な限界

ここで説明したホールドアウトの設計は、この用途で検証されていませんし、簡単には検証できません。差分の差分の比較は、あなたが何もしなければ2つの組が並行してドリフトしたはずだと仮定しますが、AIの回答エンジンがプロンプトのクラスをまたいで並行にドリフトするかどうかを検証した公表研究はありません。関連する唯一の測定は引用回数を9日連続で追ったもので、共通のトレンドではなく、頻繁に引用される集合の全体にわたる不安定さを見いだしました。したがってホールドアウトが確実に教えてくれるのは、プラットフォーム全体で何かが起きたということであって、それがどれだけの大きさかではありません。引き算を1つの補正済みの数字として公表するのではなく、2つの組を並べて示してください。ここに書いた残りのことは、発見ではなく規律です。出所の刻印はレポートを検証可能にしますが、それは正しくすることとは違います。

製品が役に立つ場面と、立たない場面

このレポートの正体は表計算シートと、そこで正直でいるという決断です。プロンプトの一覧にバージョンを付け、12個ほどのプロンプトをホールドアウトとして印を付けて絶対に触らず、すべての数字にエンジン、観測数、日付、バージョンを刻み、実際にそうだったときは「検出可能な変化なし」と書いてください。Bavior は固定のプロンプトパネルを5つのエンジンに定期実行し、空のものも含めてすべての実行を保持し、あなたのものでないURLも含めて被引用URLをすべて記録し、エンジンごとに報告します。やらないのは、どのプロンプトをあなたのホールドアウトにするかを決めること、誰もそれに最適化しないよう強制すること、引用からトラフィックや売上を予測することです。無料 AI 可視性チェッカー無料 GEO 診断は有料プランなしで使えます。有料プランは月払いで月額 $99 から、年払いなら月額 $79.17 です(2026年8月30日時点)。

出典、すべて2026年8月30日に確認
  1. 「Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)」2026年7月15日、arXiv:2607.14035。表5と表6(サーベイのプレプリント):arxiv.org/abs/2607.14035
  2. Jaźwińska & Chandrasekar、Tow Center for Digital Journalism「AI Search Has a Citation Problem」2025年3月6日。8つのエンジンにわたる1,600件のクエリ、60%超が誤り:cjr.org
  3. Pew Research Center、2025年7月22日。AIの要約の中のソースをクリックした訪問はおよそ1%:pewresearch.org
  4. Sielinski「Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement」2026年3月、arXiv:2603.08924(プレプリント):arxiv.org/abs/2603.08924
  5. Grossman ほか「How Generative AI Disrupts Search」SIGIR 2026。11,500件のクエリ、Googleのオーガニック結果、AI Overviews、GeminiのあいだのURLレベルのJaccardは0.11–0.18:arxiv.org/abs/2604.27790
  6. AI Overviewの引用の時系列。2025年7月に採取された190万件の引用と、2026年3月の863,000件のキーワード結果ページにわたる400万件の被引用URLとの比較。被引用ページのうちオーガニック上位10位にも入っていた割合は約76%から約38%に低下。ベンダー公表のため、本カリキュラムの出典方針に従い、記述のみでリンクはしません。
  7. Puerto ほか「C-SEO Bench: Does Conversational SEO Work?」NeurIPS 2025 Datasets & Benchmarks Track、arXiv:2506.11097:arxiv.org/abs/2506.11097
よくある質問

よく聞かれることを、まとめました。

プロンプトのホールドアウトセットはどのくらいの規模にすべきですか?

10〜15個で、パネルの残りのクラス構成を映すように選びます。個数より構成のほうが重要です。実際に手を入れているプロンプトの3分の1が比較型の質問なら、ホールドアウトの3分の1もそうであるべきです。プロンプトのクラスによってドリフトの速さが違い、定義型の質問だけで作ったホールドアウトは、比較型の質問に当たった変化を追えないからです。パネルを作るときに凍結し、ほかのすべてと一緒にバージョンを付け、新しいメンバーがうっかりそのためのコンテンツを書いてしまわないほど明確に印を付けてください。それ自体の区間は幅が広くなるので、その動きは精密な補正ではなく方向として読んでください。

パネルにバージョン番号が必要なのはなぜですか?

プロンプトを1つ足したり外したりすると、ページ上のすべての比率の分母が変わるからです。だから異なるパネルのバージョンから出た2つの数字は、見た目が同じでも比較できません。2部構成のバージョン番号を使ってください。マイナーの繰り上げは、プロンプトが何を尋ねているかを変えない文言修正で、これをまたぐ比較は脚注があれば問題ありません。メジャーの繰り上げは、プロンプトの追加、削除、範囲変更で、この場合は比較せずベースラインを取り直します。バージョンはすべての数字の横に印刷し、プロンプトの一覧はバージョン管理に置いて、誰でも2つのバージョンをdiffできるようにしてください。測定しようとしている施策を出すのと同じ期間に、パネルを変えてはいけません。

AI可視性レポートに推定トラフィックを入れるべきですか?

入れるべきではありません。掛け合わせるべき係数が測定されたことがないからです。この分野自身の2026年のサーベイは、引用スコアがクリック、コンバージョン、売上を予測するという主張を確信度が非常に低いと評価しており、Pew Research Centerの2025年7月の閲覧調査では、AIの要約の中のソースをクリックした訪問はおよそ1%でした。経営陣が商業的な言い方を必要とするなら、グラフではなく、仮定を名指しする一文として書いてください(「読者のおよそ1%がクリックし、この質問が頻繁に尋ねられるとすれば」)。グラフにすれば、2回目の会議までに測定結果として引用されます。

数字が動かなかったとき、レポートには何を書けばよいですか?

「検出可能な変化なし」と書き、そのパネルが検出できたはずの最小の変化を横に印刷してください。「言及率31%、観測200件、先月の29%から検出可能な変化なし。検出可能な最小の変化はおよそ13ポイント」と書けば、何が分かって何が分からなかったのかが読み手に正確に伝わります。一方「2ポイント上昇」は偽りを伝えます。そのうえで、実際に変わったものを報告してください。あなたの比率が動かない月でも引用リストは動いていて、行動はそこにあります。誰のページが誰を置き換えたのか、自社のどのページが一度も出てこないのか、どの回答があなたについて事実でないことを言うようになったのか、です。

Bavior 編集部

Reddit マーケティングと AI 検索可視性に関する Bavior のコンテンツを調査・管理しているチームです。記事中のすべての数値には出典と確認日を明記しており、アフィリエイトリンクは一切使用していません。

数値に誤りを見つけたらお知らせください。再確認します: support@bavior.com

どの数字にも出所を刻む。
そうしてはじめて、説明できます。

無料トライアルを開始