ホーム/GEO を学ぶ/測れないもの
AI可視性の測定 · 限界

AI可視性の測定には、どんな限界がありますか?

この分野の4つの問いには、計測器がありません。あるふりをすることが、GEOのレポートが信用を失う主な経路です。役に立つのは、こっそり見積もることではなく、それぞれの範囲を声に出して示すことです。

このページの内容
この記事をシェア
X でシェア LinkedIn でシェア
短い答え

AI可視性には、計測器のないものが4つあります。プロンプトが何回聞かれているか、引用が生んだ売上、検索していないときにモデルがあなたについて何と言うか、そして特定の買い手が実際に見た答えです。どれも、より良い道具を待っているのではなく、必要な観測そのものが欠けています。だからこっそり見積もるのではなく、範囲を声に出して示してください。2つ目については、Pew Research Centerの2025年3月の閲覧パネルで、GoogleのAI要約が付いたページへの訪問のうち、その要約内のリンクをクリックしたのはわずか1%でした。つまりこうした接点の大半は、アナリティクスが記録できるイベントを残しません。2

重要ポイント
  • ボリュームではなくカバレッジを報告してください。プロンプトの頻度を公開しているエンジンはないので、言及率はあなたが選んだ質問の性質であって、市場シェアには決してなりません。
  • 引用を売上に換算しないでください。この分野自身の2026年のサーベイは「引用スコアはクリック、コンバージョン、売上を予測する」の確信度を非常に低いと評価しており、これは最低の段階です。3
  • それぞれのギャップを3つの文で範囲づけてください。推定対象を言う、実際に手元にある計測器を言う、そしてその読みが間違いだと示す観測を言う、の3つです。
欠けている分母

あなたのプロンプトが何回聞かれているか、なぜ誰も教えられないのか?

プロンプトの頻度を公開しているエンジンはなく、それを再構成できるものもありません。だからあなたが報告するどの比率も、分子は測ったもの、分母は作り出したものです。なぜこの数字が存在しないのか、ベンダーが出すプロンプトボリュームの数字が実際に何でできているのかは、プロンプトボリュームは存在しないの記事で追っています。レポートにとって大事なのはその帰結です。あなたの言及率は、あなたが選んだ質問の性質であって、市場の性質ではありません。

これは、レポートが何を主張してよいかに具体的な影響を1つ与えます。「私たちは答えの34%で名前が挙がっています」は、あなたのパネルについての説明できる文です。「私たちはこのカテゴリのAIの答えの34%で名前が挙がっています」はそうではありません。後者は誰も持っていない分母を前提にしているからです。パネルを文の中に書き込めば、その主張は本当になります。

あなたに使える範囲は、ボリュームではなくカバレッジです。観測できる需要を取ってください。自社のサーチコンソールにある疑問形クエリ、商談の最初の質問、トライアル初週に開かれたチケットです。そのうちどれだけをパネルが占めるかを述べれば、本物の分母を持った本物の分数になります。ここで言える一番強いカバレッジの主張です。パネルに重みを付けるのに役立つ、公表済みのシグナルが1つあります。2026年3月13日から4月21日にかけて集められた55,393件のクエリの研究は、Google AI Overviewの発動率を全体で13.7%、疑問形のクエリでは64.7%と測定しました。1 AIの答えが起きるのは疑問形のプロンプトです。だからそちらに重みを置いたパネルは、サーフェスが実際に存在する場所を測っていることになります。

帰属

引用を売上に帰属させられますか?

できません。理由は統計的というより機械的です。通常の場合、読者はクリックしないので、どのアナリティクスにも記録すべきイベントが存在しません。Pew Research Centerの2025年3月の閲覧パネルは、AI要約の中のソースへのクリックを訪問の約1%としています。引用がインプレッションとしてどれだけの価値を持つかは、GEOが変えることの記事で扱っています。2 この分野自身の2026年のサーベイは、引用スコアがクリック、コンバージョン、売上を予測するという主張の確信度を非常に低いと評価しており、これは最低の段階です。3

この連鎖を断つ仕組みは3つあり、いま働いているのがどれかが分かれば、どの回避策を試す価値があるかも分かります。1つ目は失われたクリックです。答えで満足した読者は、決してセッションになりません。2つ目は失われたリファラーです。チャットクライアントはリファラーをまったく送らないことが多く、実際に起きた訪問がダイレクトトラフィックとして届きます。3つ目は区別できないエージェントです。2025年10月30日に公開されたTow Center for Digital Journalismの分析は、ウェブサイトから見るとエージェント型ブラウザのエージェントは「標準のChromeブラウザを使っている人と区別できない」と報告し、そうしたブラウザが同じベンダーの標準インターフェースでは取れなかった購読者限定の資料を取得したとしています。4 この種のトラフィックは急速に増えています。Cloudflareのネットワーク全体の2025年レビューは、ユーザー起点のクロールがこの1年で15倍以上に増えたと報告しました。5 つまり、AIを介した接点のうちアナリティクスから見えない割合は、下がるのではなく上がっています。

失われた係数を取り戻せる回避策はありません。そう見せかけるものが出てきたら疑ってください。代わりに、モデリングの仮定を1つの文として述べ、入力を明示し、不明なものは不明と記し、決してグラフにしないでください。グラフは2回目の会議までには測定値として引用されます。

もう一つの答え

リトリーバルなしでモデルが何と言うかは測れますか?

サンプリングはできますが、時間を追って追跡することはできません。計測器のほうが足元で変わってしまうからです。モデルが検索せずに答えるとき、あなたの製品の説明は、点検もできず、編集もできず、計画的に働きかけることもできない学習データから来ます。今日それをサンプリングするのは簡単です。検索を切って質問し、返ってきたものを読むだけです。問題は2回目の測定です。

時系列には固定された計測器が要りますが、モデルはそれではありません。リリースごとに新しいコーパス、新しいカットオフ、新しいポストトレーニングになります。だから2回の無検索測定のあいだの変化は、あなたの評判の変化かもしれませんし、モデルの変化かもしれません。データの中にその2つを区別するものはありません。バージョン表示さえ役に立たないことがよくあります。1つの製品名が、告知なく別のチェックポイントに振り分けられることがあるからです。2026年の批判的サーベイは「商用エンジンは互いに異なり、時間とともに変化する」を確信度高いと評価しています。リトリーバルなしの時系列は、まさにそれがないことを必要とするものです。3

ですから無検索の実行は、モデルのバージョンを刻んだ定期的なスナップショットとして扱い、定性的に読んでください。それは本当に役に立つ問いに答えます。何も読んでいないとき、このシステムは私たちについて何を信じているのか、です。そして、あなたの製品についての誤った事実がコーパスに定着したことを知る、いちばん早い警告でもあります。日付とバージョンの横に引用テキストとして報告し、決してトレンドラインにはしないでください。

1回の実行、1つのセッション

実際の買い手が本当に見た答えは測れますか?

測れません。そしてこれは、データのノイズと取り違えられることが最も多い限界です。パネルはクリーンルームのようなセッションを走らせます。まっさらな文脈、サインインしていない状態、固定のロケール、検索はオン、プロンプト1件につき1回の実行です。買い手はそのどれも固定してくれません。Anthropicは、Claudeが「チャットしながら記憶を個別のトピックの集まりとして保存する」こと、それを後の会話に持ち越すこと、ユーザーがオフにできることを文書化しています。つまり同じ質問をする2人は、同じシステムに問い合わせていません。7 あなたが走らせる実行では、彼らの状態は再現できません。

もう半分は非決定性で、パーソナライズと違い、少なくとも定量化できます。2026年3月のAI可視性の統計的な取り扱いは「引用ランキングはサンプル間で不安定であり、それは上位ドメインのあいだだけでなく、頻繁に引用されるドメイン集合の全体にわたる」と報告し、ブートストラップ区間はドメイン間の見かけ上の差の多くを「測定プロセスのノイズフロア」の内側に置くとしています。6 2026年の批判的サーベイは、監査の側から同じパターンを記録しています。商用の監査は「低い出典の重なり、実行ごとの大きなばらつき、そして解消されない忠実度のギャップ」を示します。3

そこから出てくる実務のルールは、1回の実行を1つの観測として扱うのをやめることです。プロンプトごとに繰り返し、点推定ではなく区間を付けて比率を報告し、週次の動きはその区間を越えてはじめて本物と呼んでください。サーベイ自身のチェックリストが複数の言い換えと反復を求めるのも、この理由です。3 何回繰り返せばよいかは算数で、統計的検出力の記事で計算しています。反復では決して手に入らないのが、その買い手自身の答えです。それは観測できないままなので、セッションの設定は付録ではなく数字のすぐ横に書いておいてください。

代理指標

残す価値のある代理指標はどれで、どうラベルを付けますか?

残す価値のある代理指標は3つあります。どれも、何を支えられないかを明記したラベルを付けてはじめて安全になります。

01

自己申告の帰属

サインアップ時の自由記述の「どこで知りましたか」欄は、アシスタントが関わったことを買い手が伝えられる唯一の場所です。ラベル:自己選択で、こちらから促しておらず、接点を覚えていない人によって系統的に過少申告されます。

02

購買意欲の高いページへのクローラーのフェッチ

料金ページや比較ページへの検索側およびユーザー起点のフェッチは、本物の需要シグナルです。クローラーログの読み方の記事で扱っています。ラベル:関心の先行指標であって成果ではなく、個人に帰属させられません。

03

指名検索とダイレクトトラフィック

指名検索や直接訪問の増加が言及率の上昇と同時に起きるのは、弱い裏づけです。ラベル:同じ期間の他のあらゆるマーケティング活動と交絡しており、ホールドアウト期間がなければ使えません。

ここでの規律は、そのラベルがすべてです。注意書きを剥がされた代理指標は、語り直されるうちに測定値になります。だから注意書きは脚注ではなくグラフのタイトルに書いてください。そうすれば、あなたのいないところでスライドが転送されても、その数字は正直なままです。

その方法

測れない問いに、どう範囲を与えますか?

問いに範囲を与えるとは、点推定ではなく、明示した幅と明示した仮定で答えることであり、3つの文で済みます。推定対象を言う:本当は何を知りたいのかを正確に書き出してください。たとえば「先四半期に、アシスタントの中で私たちについての見方を作った買い手は何人か」です。曖昧なままだと、代理指標がこっそりその代わりに座ってしまいます。計測器を言う:実際に手元にあるものと、それが何を測っているのかを述べてください。つまり200観測のパネルが測っているのは、ある日付の範囲で、5つのエンジンで、あなたが選んだ質問のうちあなたの名前が挙がった割合です。反証条件を言う:どんな観測があればその読みが間違いだと分かるかを述べてください。範囲の場合、それはたいてい、崩れたら成り立たなくなる仮定を名指しすることを意味します。

書き出すと、範囲を示した主張はこうなります。「60プロンプトの当社パネルでは、7月、5つのエンジンのうち4つが答えの28–36%で当社の名前を挙げました。エンジンあたり200観測です。それらの質問が何回聞かれているかは分からないので、これは市場シェアではありません。当社の買い手がパネルと実質的に異なる質問をしているなら、この数字は彼らを説明しません。」この段落はたいていのエグゼクティブサマリーより短く、誤って引用されようがありません。そこが要点です。

同じ規律を、研究の文献も自らに課しています。2026年の批判的サーベイの推奨は、取得可能なページを作ったうえで「リトリーバル、引用、忠実度を別々に測る」ことです。そして最小限の研究チェックリストは、製品、モード、モデル、日付、ロケール、アカウント、そして検索が有効だったかどうかを読み取りごとに記録すること、ヌル結果を捨てずに保持することを求めています。3 これらは測定を止めるものではありません。止めるのは、その測定が、そもそもそのために作られていない主張を背負わされることです。

この記事の正直な限界

ここで述べた4つの限界は、今日の構造上のものであって自然法則ではなく、そのうち2つは塞がる可能性があります。もしどこかのエンジンがプロンプトの頻度を公開したら、あるいはアシスタントが一貫したリファラーを渡すようになったら、このページの最初の2つの節は四半期のうちに時代遅れになります。そうなるかどうかを前もって知る方法はありません。残りの2つはもっと厄介です。リトリーバルなしの時系列には固定された計測器が要りますが、学習し直されたモデルはそれではありません。そして、ある1人が見た答えは、その人以外の誰にも観測できません。ここで引いた最も強い数字にも注意してください。およそ1%というクリックの数字は、2025年3月の米国成人900人の行動パネル1件から来ており、測っているのはGoogleのAI要約です。入手できるかぎり最良の独立した証拠であると同時に、1つの国の、1つのサーフェスの、1か月の、1つの研究です。

製品が役に立つ場面と、立たない場面

範囲を示すのに要るのは規律だけで、お金はかかりません。推定対象と計測器と反証条件をレポートに書き、サインアップに自由記述の流入元欄を足し、引用をセッションに換算するのをやめてください。Bavior は固定のプロンプトパネルを5つのエンジンに定期実行し、あなたのものでないURLも含めて被引用URLをすべて記録し、混ぜたスコアではなくエンジンごとに報告します。やらないのは、このページの4つそのものです。質問が何回聞かれているかは答えられません。どのエンジンも公開していないからです。引用からトラフィックや売上を予測しません。この分野自身のサーベイがその結び付きを確信度・非常に低いと評価しているからです。検索していないときにモデルがあなたについて何を信じているかも、スナップショットを自分で読めるようにする以上のことはできません。そして、ある1人の買い手が見た答えを見せることもできません。そのセッションは彼らのものだからです。無料 AI 可視性チェッカー無料 GEO 診断は有料プランなしで使えます。有料プランは月払いで月額 $99 から、年払いなら月額 $79.17 です(2026年8月29日時点)。

出典、すべて2026年8月30日に確認
  1. Xu, Iqbal & Montgomery、2026年。2026年3月13日から4月21日に集めた55,393件のクエリ。「AIOの発動は全体で13.7%、疑問形クエリでは64.7%に上昇」(プレプリント):arxiv.org/abs/2605.14021
  2. Pew Research Center、2025年7月22日。米国成人900人の閲覧パネル、68,879件の検索、2025年3月。AI要約の中のリンクのクリックについて「これはそうした要約が付いたページへの全訪問のわずか1%で起きた」:pewresearch.org
  3. 「Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)」2026年7月15日、arXiv:2607.14035。確信度の表と最小限の研究チェックリスト(サーベイのプレプリント):arxiv.org/abs/2607.14035
  4. Chandrasekar & Jaźwińska、Tow Center for Digital Journalism「How AI browsers sneak past blockers and paywalls」2025年10月30日。エージェント型ブラウザは「標準のChromeブラウザを使っている人と区別できない」:cjr.org
  5. Cloudflare Radar 2025 Year in Review、データ期間2025年1月1日から12月2日。「AIの『ユーザーアクション』クロールは2025年に15倍以上に増加した」:blog.cloudflare.com
  6. Sielinski「Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement」2026年3月、2026年8月26日改訂、arXiv:2603.08924(プレプリント):arxiv.org/abs/2603.08924
  7. Anthropic「Use Claude’s chat search and memory to build on previous context」(記憶はチャットをまたいで保存され、ユーザーが制御できる。一次情報):support.claude.com/en/articles/11817273
よくある質問

よく聞かれることを、まとめました。

自分のカテゴリについて、何人がAIに聞いているかはどうすれば分かりますか?

分かりません。プロンプトの頻度を公開しているエンジンはなく、それを再構成できる代理指標もないからです。正直に測れるのはボリュームではなくカバレッジです。買い手が実際に聞いているのを観測した質問、つまり自社のサーチコンソールにある疑問形クエリ、商談の最初の質問、トライアル中に開かれたチケットを取り、そのうちどれだけをパネルが含んでいるかを述べてください。「このパネルは、私たちが観測した55の異なる質問のうち40をカバーしている」は、本物の分母を持つ本当の文です。「私たちはカテゴリのAIの答えの34%に登場する」はそうではありません。その分母を誰も持っていないからです。

取締役会に向けて、AI可視性に売上の数字を付けられますか?

測定値としては付けられませんが、代わりに範囲を示した主張なら述べられます。引用から売上への連鎖は3か所で切れます。読者はたいていクリックせず、Pew Research Centerの2025年3月の閲覧パネルはAI要約の中のソースへのクリックを約1%としました。チャットクライアントはリファラーを送らないことが多く、実際に起きた訪問はダイレクトトラフィックとして届きます。そしてエージェント型ブラウザは、サーバーログでは人と区別できません。仮定を名指しし、不明なものを不明と記した文を書き、グラフの形にしないでください。グラフは測定値として引用されます。

検索がオフのときにモデルが私について何と言うかは、追跡すべきですか?

定期的にサンプリングし、モデルのバージョンを刻み、プロットせずにテキストとして読んでください。無検索の答えは、点検も編集もできない学習データから来ます。だからこそ、あなたの製品についての誤った事実がコーパスに定着したことを知る最も早い警告になり、それは本当に知る価値があります。支えられないのは時系列です。モデルのリリースごとに新しいコーパスと新しいカットオフになるので、2回の測定のあいだの変化は、評判の変化ではなくモデルの変化かもしれず、データの中にその2つを分けるものはありません。

問いに範囲を与えることと、見積もることの違いは何ですか?

見積もりは点の値を出し、仮定を隠します。範囲は幅を出し、仮定を名指しします。範囲を与えるには3つの文が要ります。推定対象、つまり本当は何を知りたいのかを述べる。計測器、つまり実際に手元にあるものとそれが何を測るのかを、パネルとエンジンと日付の範囲を含めて述べる。反証条件、つまりどんな観測があればその読みが間違いだと分かるかを述べる。「60プロンプトの当社パネルでは、7月、5つのエンジンのうち4つが答えの28–36%で当社の名前を挙げた。エンジンあたり200観測。それらの質問が何回聞かれているかは分からないので、これは市場シェアではない」は誤って引用されようがなく、それがまるごと利点です。

Bavior 編集部

Reddit マーケティングと AI 検索可視性に関する Bavior のコンテンツを調査・管理しているチームです。記事中のすべての数値には出典と確認日を明記しており、アフィリエイトリンクは一切使用していません。

数値に誤りを見つけたらお知らせください。再確認します: support@bavior.com

測れないものには、範囲を示す。
そうすれば、残りは信頼できます。

無料トライアルを開始