評価の列は、精度でもコストでも指標を並べていません。信頼できる4つのうちいくつかは、高くつくうえにノイズも多いのです。並べているのは、動いたときに行動が導かれるかどうかです。あるエンジンで言及率が下がれば、そのエンジンの引用リストを見に行くことになりますが、混合スコアが下がっても、どこか特定の場所に向かうことはありません。土台にある6つの量は、姉妹記事の6つの可視性で定義しています。
どのGEO指標が信頼でき、どれが使えないのか?
このカテゴリの指標にはどれも失敗パターンがあり、それを知っていることが、行動に移せる数字と、弁明が必要な数字を分けます。クロスエンジンの混合スコアはダッシュボードの既定の出力であり、それが支える唯一の判断を、それ自身が壊してしまいます。
このページの内容
信頼できるGEO指標は4つです。エンジンごとに区間を付けて報告する言及率と引用率、あなたが名前を挙げて凍結した競合セットに対するシェア・オブ・ボイス、そして人がサンプルを読んで判定する表現の正確性です。使えないものも4つあります。単一のクロスエンジン混合スコア、プロンプト単位の週次増減の矢印、引用から導いたトラフィックや売上の数字、そしてセンチメントスコアです。なかでも混合スコアの崩れ方が最もひどく、11,500件のクエリを扱ったSIGIR 2026の研究は、Googleのオーガニック結果、AI Overviews、Geminiがリトリーバルするソースのあいだで、Jaccard類似度を0.11から0.18と測りました。1
重要ポイント- 指標が信頼できるのは、それが動いたときに誰かの次の行動が変わる場合だけです。
- エンジンごとに報告し、区間を印刷してください。エンジンをまたいだ平均は、実際に動いた2つのエンジンを隠します。
- 引用をトラフィックや売上に換算してはいけません。Pew Research Centerは、AIの要約の中のソースをクリックした訪問がおよそ1%だったと報告しています。8
どの指標が検証に耐え、どれが耐えないのか?
指標が検証に耐えるのは、それが動いたときに誰かの次の行動が変わる場合です。下の8つのうち4つはその基準を満たし、4つは満たしません。
役に立つのは最後の列です。ある読み取りが誤りだと示す観察を、そこで名指ししています。
| 指標 | 評価 | その読み取りが誤りになる条件 |
|---|---|---|
| エンジン別の言及率、区間付き | 信頼できる | 区間が前期のものと重なる、あるいは両期のあいだでパネルのバージョンが変わった |
| エンジン別の引用率、区間付き | 信頼できる | 言及率と逆方向に動き、そのうち一方しか報告されていない |
| シェア・オブ・ボイス、競合セット固定 | 信頼できる | 比較の期間の途中で、数えるセットにブランドが入ったか抜けた |
| 表現の正確性、人が読んだサンプル | 信頼できる | 同じ評価基準を当てた2人の読み手が、回答の5分の1超で食い違う |
| 回答内での位置 | 慎重に使う | 単一の回答で読む、あるいは引用するソース数が異なるエンジン間で比べる |
| 単一のクロスエンジン混合可視性スコア | 信頼できない | 常に該当:構成要素が独立に動くので、その平均には指し示す対象がない |
| 週次増減の矢印付きのプロンプト単位スコア | 信頼できない | その変動が、1つのプロンプトを数回実行したときの区間より小さい |
| 引用から導いたトラフィックや売上 | 信頼できない | 常に該当:両者を結ぶ係数は一度も測定されていない |
クロスエンジンの混合スコアはなぜ自らの判断を壊すのか?
混合スコアが自らの判断を壊すのは、可視性の指標が支えられる行動が「次はこのエンジンに取り組む」だけであり、エンジンをまたいで平均することが、まさにその情報を消してしまうからです。それが、このカテゴリのほぼすべてのダッシュボードの既定の出力になっています。
まず、エンジンどうしがどれだけ共有していないかから見てください。11,500件のクエリを扱ったSIGIR 2026の研究は、Googleのオーガニック結果、AI Overviews、GeminiのあいだのURLレベルのJaccard類似度を0.11–0.18と測りました。1 具体的に読んでください。2つのサーフェスが1つの問いに対してそれぞれ10個のURLを引用するなら、Jaccard 0.15は両方のリストに載るのがおよそ3個だという意味です。しかもその3つのサーフェスは、1社が、1つのインデックスの上に、1つの製品ファミリーの中で作ったものです。無関係な2つのアシスタントなら、重なりはもっと小さくなります。2026年の批判的サーベイは、そのまま引用する価値のある一文で結論を述べています。これらの結果は「グローバルなGEOランキングという考え方を否定する。可視性はエンジンとサーフェスごとにインデックスされる」。2
次に、平均が実際の1週間に何をするかを見てください。あるエンジンで言及率が8ポイント上がり、別のエンジンで6ポイント下がり、残りの3つで横ばいだったとします。混合スコアはおよそ0.5ポイント動き、レポートには「安定」と書かれます。その裏で2つのエンジンが、調べる価値のあることをしたばかりです。ここでの失敗は不正確さではありません。同じものを測っていない量どうしの、行儀のよい平均になってしまっていることです。この食い違いの仕組みはエンジンは一致するかの記事で詳しく追っています。
クロスエンジンの集約にも正当な使い道が1つだけあり、それはスコアではありません。しきい値を超えたエンジンの数を数えてください。「5つのエンジンのうち3つで、回答の4分の1以上に名前が出た」は説明できる要約の一文です。通約できない量の平均ではなく、それぞれ独立に説明できる事実の個数だからです。
表現の正確性はなぜ誰も買わない指標なのか?
表現の正確性が誰も買わない指標なのは、自動化できず、しかもレポートの見栄えを悪くするからです。そして誰もが必要とする指標なのは、ほかのどの数字も、自信を持って誤ったあなたの製品説明を勝ちとして数えてしまうからです。8つのうち、独立に確立された基礎発生率を持つ唯一の指標でもあり、その基礎発生率は良くありません。
独立した3つの測定、3つの異なる手法、同じ方向です。2025年3月6日に公表されたTow Center for Digital Journalismの監査は1,600件のクエリ(20の発行者、それぞれ10本の記事、8つのエンジン)を回し、60%超が誤った回答を返したこと、最も成績のよいエンジンでも37%は誤っていたことを見いだしました。3 同じセンターの2024年11月の研究は200件の引用を調べ、153件の回答が部分的または全面的に誤っており、不確実性が示されたのは7回だったと報告しています。4 別の独立した研究は、回答の文のうち51.5%が添付された引用によって完全に裏付けられていることを見いだし、5 2026年のプレプリントは98,020件のアトミックなクレームのおよそ11%を裏付けが不十分と分類しました。6 最後の数字が低いのは、回答ではなくクレームを数えているからで、回答はその中のどれか1つのクレームが誤っていれば誤りになります。どれを引いても構いませんが、単位を添えてください。
自社の製品でこれを測るのは、これらの研究から想像するより安く済みます。月に20件の回答をサンプリングし、誤りが商談を失わせるクラス、つまり比較型と反論型のプロンプトに重みを置いてください。いくつかの事実の軸を持つ固定した評価基準で1件ずつ採点します。料金体系、製品が何をするか、何をしないか、連携、そして安全性やコンプライアンスに関する主張です。センチメントではなく軸ごとに二値で記録し、誤った文はそのまま残して、その文を生んだページの担当者に見せられるようにしてください。2人の読み手は5件中4件で一致するはずです。一致しないなら、エンジンが気まぐれなのではなく、評価基準が曖昧すぎるということです。
出てくるのはスライド用のパーセンテージではなく、具体的な誤った文と、それを生んだ可能性が最も高いページの一覧です。その一覧をどう扱うかは引用の正確性の記事で扱っています。
シェア・オブ・ボイスは何が脆いのか?
シェア・オブ・ボイスが脆いのは、信頼できる指標の中で唯一、分母が判断で決まるからです。だから世界で何も起きていなくても、数ポイント動かせてしまいます。数えるセットに小さな競合を2つ足せばあなたのシェアは下がり、黙って外せば上がります。直し方は統計的なものではありません。競合セットに名前を付け、四半期のあいだ凍結し、バージョンを付け、そのバージョンを数字の横に印刷してください。
2つ目の脆さは構造的なもので、規律では直せず、開示するしかありません。引用ベースのシェア・オブ・ボイスは分母がエンジンに依存します。エンジンによって、1つの回答に添えるソースの数が大きく違うからです。2026年1月から4月に収集された1億2,600万件の米国のAI検索プロンプトの上に構築され、2026年6月26日に公表されたベンダーのインデックスは、あるアシスタントが1回答あたり平均およそ15のソースを引用するのに対し、別のアシスタントはおよそ3だったと報告しています。7 方向は1回答あたりの引用数に関する学術的な測定でも裏付けられているので、比率は実在するものとして扱い、正確な平均値は目安として扱ってください。引用された3つのうちの1つであることと、15のうちの1つであることは別の出来事です。だから引用ベースのシェアはエンジン間で比較できず、言及ベースのシェアのほうが安全な既定値になります。
どの数字はそもそもダッシュボードに載せてはいけないのか?
ダッシュボードに載せてはいけない数字が4つあり、それぞれ不正確だからではなく、それぞれの理由で失格になります。1つ目は、引用から導いたトラフィックや売上の数字です。その換算を許す係数は一度も測定されていません。この分野自身の2026年のサーベイは、引用スコアがクリック、コンバージョン、売上を予測するという主張を確信度非常に低いと評価しており、2 Pew Research Centerの2025年7月の閲覧調査では、AIの要約の中のソースをクリックした訪問はおよそ1%でした。8 引用回数に勝手に決めたクリック率を掛けて出てくるのは、誤差項が不明で小数点だけは付いた数字であって、推定値ではありません。
2つ目は、週次増減の矢印付きのプロンプト単位スコアです。1つのプロンプトを数回実行しただけでは、報告する価値のあるどの変動よりもはるかに広い区間を伴うので、矢印はノイズの上に引かれます。その計算は姉妹記事の統計的検出力にあります。3つ目はセンチメントスコアで、必要な信号をつぶしてしまいます。回答は口調が好意的でありながら、あなたの料金体系を誤って述べていることがあり、商談を失わせるのはその誤りのほうです。
4つ目は、式が横に印刷されていない複合指数です。ある数字が出現、位置、目立ち方の重み付き混合であるなら、知見にあたるのは重みのほうです。重みが見えない読み手は、前四半期の数字が同じ方法で計算されたのかを確認できません。式が公開されている指数は指標です。公開されていない指数は主張です。
新しい指標を足す価値があるかはどう判断するのか?
候補の指標を4つの問いにかけ、4つすべてに答えられるときだけ足してください。あなたが管理でき、口に出して言える分母があるか?分母がエンジンのトラフィック、プロンプト数、ユーザー数なら、あなたはそれを言えないので、その指標はパーセント記号を付けた当て推量です。その周りに区間を計算できるか?観測が、数えられる実行回数の上で数えられる出来事でないなら、区間はなく、変化とゆらぎを見分ける手立てもありません。
それが動いたときに判断が変わるか?データを集める前に、標準誤差2つ分の変動が引き起こす具体的な行動を書き出してください。1つも挙げられないなら、その指標は注意力が有限なページの上の飾りです。反証できるか?ある読み取りが誤りだと示す観察を名指ししてください。上の表の最後の列は、それを強いるために存在します。反証する観察を持たない指標は、何かを測っているのではなく、気分を書き表しているだけです。
いま使っているダッシュボードにも同じ4つの問いをかけてみてください。多くのプログラムでは、3つ目の問いだけで2つか3つのパネルが落ちます。
このページの評価は議論であって、測定ではありません。この8つの指標を予測妥当性について正面から比べた研究はありません。比べるには予測すべきアウトカムが要り、誰もが欲しがるアウトカム、つまり売上こそが、この分野自身のサーベイで確信度を非常に低いと評価されているものだからです。ですからここでの「信頼できる」は「言える分母、計算できる区間、そして紐づいた判断がある」という意味であって、「売上につながると示された」という意味ではありません。表現の正確性は、信頼できる4つの中で最も定義が弱いものです。標準の評価基準はなく、この課題について公表された評価者間一致度もなく、上で引いた基礎発生率は製品ではなくニュース発行者を対象にした研究から来ています。
上に書いたことはすべて表計算シートでできます。パネルを固定して実行し、本文で名前が挙がった場合とURLが添付された場合をエンジンごとに別々に数え、それぞれに二項の区間を計算し、自分で書いた評価基準に照らして月に20件の回答を読むことです。Bavior は固定のプロンプトパネルを5つのエンジンに定期実行し、混合スコアではなくエンジンごとに報告し、あなたのものでないURLも含めて引用されたURLをすべて記録します。やらないのは、引用からトラフィックや売上を予測することです。係数が存在しないからです。表現の正確性を採点することもしません。あなたの製品についての文が事実かどうかを判定するのは、あなたの評価基準に照らして回答を読む人であって、分類器ではないからです。無料 AI 可視性チェッカーと無料 GEO 診断は有料プランなしで使えます。有料プランは月払いで月額 $99 から、年払いなら月額 $79.17 です(2026年8月29日時点)。
- Grossman ほか、SIGIR 2026。11,500件のクエリ、Googleのオーガニック結果、AI Overviews、GeminiのあいだのURLレベルのJaccardは0.11–0.18:arxiv.org/abs/2604.27790
- 「Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)」2026年7月15日、arXiv:2607.14035。確信度の表、および「これらの結果はグローバルなGEOランキングという考え方を否定する。可視性はエンジンとサーフェスごとにインデックスされる」(サーベイのプレプリント):arxiv.org/abs/2607.14035
- Jaźwińska & Chandrasekar、Tow Center for Digital Journalism「AI Search Has a Citation Problem」2025年3月6日。1,600件のクエリ、20の発行者、8つのエンジン、60%超が誤り:cjr.org
- Tow Center for Digital Journalism「How ChatGPT Search (Mis)represents Publisher Content」2024年11月。20の発行者からの200件の引用、200件の回答のうち153件が部分的または全面的に誤り:cjr.org
- Liu, Zhang, Liang「Evaluating Verifiability in Generative Search Engines」2023。文の51.5%が引用によって完全に裏付けられている:arxiv.org/abs/2304.09848
- Xu, Iqbal & Montgomery、2026。98,020件のアトミックなクレームのおよそ11%を裏付けが不十分と分類(プレプリント):arxiv.org/abs/2605.14021
- AI可視性インデックス、2026年6月26日公表。2026年1月から4月に収集された1億2,600万件の米国のAI検索プロンプト。あるアシスタントは1回答あたり平均およそ15の引用ソース、別のアシスタントはおよそ3。対象としたすべてのプラットフォームで見えたブランドは36社。ベンダー公表のため、本カリキュラムの出典方針に従い、記述のみでリンクはしません。
- Pew Research Center、2025年7月22日。AIの要約の中のソースをクリックした訪問はおよそ1%:pewresearch.org
よく聞かれることを、まとめました。
目指すべきAI可視性スコアのベンチマークはありますか?
ありません。ベンチマークとして差し出される数字はどれも、比較できないパネルどうしを比べています。あなたの比率は、あなたが選んだプロンプトの関数です。ファネル下部の狭い質問を測るチームは、同じ製品について広いカテゴリの質問を測るチームより低い数字になりますが、どちらの数字も相手について何も語りません。意味のある比較は2つです。バージョンを固定した自分のパネルを自分自身と比べること、そして同じ日に同じパネルの中で、名前を挙げた競合セットに対してシェア・オブ・ボイスを見ることです。どちらも社内のものであり、だからこそ説明できます。
ダッシュボードにAI可視性スコアが1つ出ています。役に立たないのでしょうか?
命綱としては役に立ち、診断としては役に立ちません。この区別を持っておく価値があります。混合された1つの数字は、何かが見に行くだけ動いたことは教えてくれます。どのエンジンが動いたのかは教えてくれませんし、SIGIR 2026の研究が1社の作った3つのサーフェスのあいだでURLレベルのJaccardを0.11–0.18と測っている以上、構成要素はほぼ独立です。すでにページに載っているなら混合スコアは残しておき、その下にエンジン別の内訳を印刷し、誰かが取る行動はすべて混合スコアではなく内訳から引き起こされるようにしてください。
人を雇わずに表現の正確性を測るにはどうすればよいですか?
固定した評価基準に照らして月に20件の回答を読み、事実の軸ごとに二値で採点してください。商談を失わせる軸を選びます。料金体系、製品が何をするか、何をしないか、連携、そしてコンプライアンスや安全性に関する主張です。スコアではなく誤った文をそのまま記録してください。行動できるのは文のほうだからです。サンプルは、誤りが最も高くつく比較型と反論型のプロンプトに重みを置きます。2人の読み手は少なくとも5件中4件で一致するはずで、しないなら、エンジンが気まぐれなのではなく評価基準が曖昧すぎるということです。
引用を推定トラフィックに換算できないのはなぜですか?
掛け合わせるべき係数が一度も測定されておらず、関連する唯一の公開数字はそれがほぼゼロだと言っているからです。Pew Research Centerの2025年7月の閲覧調査では、AIの要約の中のソースをクリックした訪問はおよそ1%でした。またこの分野自身の2026年のサーベイは、引用スコアがクリック、コンバージョン、売上を予測するという主張を確信度が非常に低いと評価しています。モデル化の仮定を口に出して述べることはできます。「読者の1%がクリックし、このプロンプトがN回尋ねられるとすれば」という形です。ただしNは不明の仮定として提示し、測定として提示しないでください。グラフとして現れた瞬間、それは測定として引用されます。
Reddit マーケティングと AI 検索可視性に関する Bavior のコンテンツを調査・管理しているチームです。記事中のすべての数値には出典と確認日を明記しており、アフィリエイトリンクは一切使用していません。
数値に誤りを見つけたらお知らせください。再確認します: support@bavior.com