AI検索の仕組み · 診断法

なぜこれほど多くのGEOの助言は誤っているのか?

4つの問いで、この分野のほとんどの主張は「裏づけがある」「いちばん難しい部分を飛ばした場所で測られた」「メカニズムがない」の3つに仕分けられます。その4つを、組み立ての土台になった結果と一緒に示します。

このページの内容
この記事をシェア
X でシェア LinkedIn でシェア
短い答え

GEOの助言の多くが誤るのは、それがパイプラインの最後のステージに作用し、しかも最初の4つのステージを切った環境で測られたからです。どんな主張も、それがどのステージに作用するのか、そして誰かが測ったときリトリーバルが動いていたのかを問えば仕分けられます。171,003件の文書に対してリトリーバルと再ランキングを戻したKDD 2026のベンチマークは、本文だけの最適化が平均の上位20件出現率を9%、最終引用率を6%下げると測定しました。1

重要ポイント
  • その施策が5つのパイプラインステージのどれに作用するのかを問いましょう。解釈とファンアウトはあなたのサイトからの入力を一切受け取らないので、そこを狙った施策には通り道になるメカニズムがありません。
  • その効果が測られたとき、リトリーバルと再ランキングが動いていたのかを問いましょう。文書を先にモデルのコンテキストへ置く研究は、そのページがリトリーバルされたかどうかを語れません。
  • その施策が誰のためのものかを問いましょう。創始論文自身の表では、最も強い3つの書き換えが、すでに1位だった情報源の可視性を20%から30%削り、5位の情報源はおよそ倍にしました。2
根本原因

なぜこれほど多くのGEOの助言は誤っているのか?

いちばん手を出しやすいステージが、いちばん単独で測りやすいステージでもあり、この2つが重なって1つの業界になったからです。ページの書き換えは、インフラに触れずに1人が午後いっぱいで終えられます。だから助言はそこに集まりました。書き換えの測定も、固定した文書群をモデルに渡して言い回しだけを変えれば簡単です。だから初期の実験もそこに集まりました。その結果、すでにモデルのコンテキストに入っている文書に何が起きるかという本物の知見の山が、オープンウェブ上のページに何が起きるかという主張へと一般化されました。

2026年の批判的サーベイは、自身の確信度表でその線を引いています。すでにコンテキストに置かれた文書が、自らの順位、引用、利用を因果的に変えうることは高い確信度と評価され、この証拠は「オーガニックなリトリーバルを扱っていない」という注記が添えられます。ホワイトハットな介入が複数のエンジンにわたってオーガニックな発見可能性を持続的に改善することは低いと評価されます。引用スコアがクリック、コンバージョン、売上を予測することは非常に低いと評価されます。3 この分野の失望はほぼすべて、1行目と残り2行の間の隙間に住んでいます。AI検索の仕組みというステージが、この診断法が仕分けの相手にするパイプラインです。

診断法

GEOの主張を、それが作用するステージで仕分けるには?

GEOの主張は、5つのパイプラインステージのどれに作用するのか、そのステージであなたの持ち物が入力になるのか、その効果にどんな証拠があるのか、そして効果量はどれくらいかを問うことで仕分けられます。

この4つを順番に問いましょう。ほとんどの主張は1つ目か2つ目で止まります。

01

どのステージに作用しますか?

正直な答えが解釈かファンアウトなら、メカニズムはありません。この2つのステージはどの文書にも触れる前に走り終わり、あなたのサイトからの入力を受け取らないからです。答えがリトリーバルなら、証拠はいちばん強くなります。統合なら、証拠はいちばん弱く、しかもその施策は上流であなたに損をさせうります。

02

測られたとき、前のステージは動いていましたか?

その研究が文書をモデルのコンテキストに置いてから言い回しだけを変えたのなら、結果は本物ですが、そのページがリトリーバルされたかどうかは語れません。この設計上の選択1つが、この分野の楽観的な結果と悲観的な結果を分けています。

03

分母は何で、日付はいつですか?

この分野では、この2つがないとパーセンテージは読めません。同じデータでも回答あたりのシェアと引用あたりのシェアは数十ポイント違いますし、これらのシステムは月ごとに変わります。2025年には、ある大規模フォーラムに対するあるエンジンの引用率が、1か月のうちにおよそ50ポイント動きました。

04

全員がやり始めても、まだ効きますか?

NeurIPS 2025のベンチマークは、採用が広がるほど利得が下がることを見つけ、この問題を「混雑したゼロサム」と表現しています。4 やる人が少ないから効くものには賞味期限があり、いま読んでいる助言そのものが、その期限を前倒しします。

逆転

エンドツーエンドのベンチマークは実際に何を示したのか?

エンドツーエンドのベンチマークが示したのは、文書がコンテキストに入ってからは勝てる書き換えが、その文書からコンテキストの席を奪いうるということです。KDD 2026のベンチマーク論文は、171,003件の文書と2,700件のクエリからなる環境を作り、初期のベンチマークのように候補集合を前もって固定するのではなくリトリーバルと再ランキングを戻したうえで、本文だけの最適化が平均の上位20件出現率をおよそ9%、再ランキング後の上位10件出現率を16%、最終引用率をおよそ6%下げることを測定しました。自動最適化器を本文だけに当てると、損失はさらに大きくなりました。1

2026年の批判的サーベイの読み方は、どちらかに肩入れするのではなく、KDD 2024の結果との見かけ上の矛盾を解きほぐします。書き換えは「したがって、いったん注入されれば好成績を残す一方で、上流ではその文書をリトリーバルされにくく、あるいは競争力の低いものにしている可能性がある」のです。3 どちらの数字も別々のものについての正直な測定であり、あなたが実際に経験するのはその合成です。

これが示していないことも正確に押さえてください。これはKDD 2026に採択された、1つのチームが作った単一のベンチマークです。テストしたのは本文だけの最適化であって、ありうるすべての介入ではありません。そして統制されたコーパスは生きたウェブではありません。ここで確立されることはもっと狭く、それでも決定的です。リトリーバルのあとでしか評価されていないコンテンツ施策は、評価されていません。そして少なくとも一度、誰かが確かめたとき、合計は負に出ました。

1位のペナルティ

すでに1位なら、GEO施策は不利に働きますか?

働きます。KDD 2024の結果では、最も成績のよい3つの書き換え施策が、すでに1位だった情報源の可視性を20–30%削り、5位の情報源はおよそ倍にしました。つまり同じ施策が、挑戦者には利得、首位には損失になります。

下の表は、情報源のもとのGoogle順位別に見た可視性の相対変化で、KDD 2024論文自身の結果表から取っています。この表を引用する人はほとんどいません。2

書き換え施策その情報源がもともと1位だった場合5位だった場合
出典の明示−30.3%+115.1%
引用文の追加−22.9%+99.7%
統計の追加−20.6%+97.9%
権威的な語調−6.0%+6.1%
流暢さの最適化−2.0%+2.2%

これらの施策は、可視性を無から作り出すのではなく、回答のシェアを下位の情報源へ再配分します。つまり普遍的な底上げではなく平準化であり、誰が採用すべきかを変えます。あなたが5位の挑戦者なら、この測定における上振れは大きいです。すでにあるクエリで1位の結果を持っているなら、攻めた書き換えは最良の資産に対する下振れリスクであり、そう言っているのは同じ論文の数字です。

実務のルールは地味です。まだ勝てていないページでテストし、変更は戻せる大きさにとどめ、1枚のビフォーアフターのスクリーンショットを結果として読むのではなく、出現と引用を別々に、繰り返し実行して測ることです。

棚卸し

よく見る主張のうち、このテストに真っ先に落ちるのはどれですか?

いちばん繰り返されるGEOの主張のうち4つは、ステージテストに真っ先に落ちます。見出しになったパーセンテージの向上、AI引用全体に占める単一プラットフォームのシェア、引用のレバーとしてのschemaマークアップ、そして可視性ファイルとしてのllms.txtです。それぞれを訂正と一緒に、下にそのまま書き出します。

ステージテストに落ちるもの

  • 「GEOは可視性を40%高める」は、2026年の批判的サーベイに一般的な主張としては棄却されています:ある1つの設定のもとで1つの指標に対する相対的な最大値であり、しかもすでにコンテキストにあるページについての値だからです
  • 「schemaマークアップを追加するとAI引用が増える」は成り立ちません。唯一のマッチドコントロール試験、1,885ページ対4,000の対照ページはAI Overviewsで−4.6%を測定しており、Googleも特別なschema.orgデータは不要だと明言しています
  • 「AIテキストファイルを公開すればエンジンに見つけてもらえる」は成り立ちません。Google は Search 自体がそうしたファイルを使わないと明言しており、137,210ドメインの研究では97%がリクエストをゼロ件しか受けていませんでした
  • 「あるフォーラム1つがAI引用の40.1%を占める」は、公表された値の合計がおよそ208%になる回答ごとの出現率の図にたどり着き、それらはそもそもシェアではありませんでした
  • 「AI引用のX%はオーガニックのトップ10から来る」は、分母と日付がなければ読めません。公表されている数字はおよそ6分の1から4分の3超まで広がっています
  • 「JavaScriptをレンダリングするAIクローラーは1つもない」は2024年12月のログ研究1件だけを出典とし、再現されたことがなく、Google、Applebot、エージェント型ブラウザについては誤りです
  • 「AIのキーワードに合わせてページを最適化する」は成り立ちません。キーワードの詰め込みは、KDD 2024の結果の中で唯一、何もしないことよりスコアが低かった施策です

ステージテストを生き延びるもの

  • インデックスされ、スニペット表示の対象であること:エンジン自身が明記した要件、ステージ3
  • JavaScriptなしでテキストを返すこと:無料で、ステージ3のエンジン固有のリスクを1つ消せます
  • 学習用トークンではなく、検索ボットのトークンを確認すること:どのベンダーも文書で分けています
  • 実在するサブ質問に本当に関連していること:サーベイでいちばん強いレバー
  • そのサブ質問に最初の一文で答え、それだけで完結していること:ステージ4
  • 本文に、実在する、日付入りの、出所のある数字と、素直な定義を置くこと:ステージ4と5
  • エンジンごとに、繰り返し実行して報告し、リトリーバルと引用と正確性を分けること
残るもの

テストを生き延びるのは何ですか?

生き延びるのは、2026年の批判的サーベイが一文で述べる、短くて退屈なリストです。「関連性があり、網羅的で、検証可能で、構造が明確で、技術的に取得可能なページを作る。そのうえでリトリーバル、引用、忠実性を別々に測る。」3 この一文はどの節も仕事をしています。関連性はステージ3です。網羅性はステージ2です。ファンアウトがサブ質問ごとにリトリーバルするからです。検証可能性と構造の明確さはステージ4です。技術的な取得可能性は、そのすべての前にある関門です。そして3つの結果を別々に測ることが、四半期をまるごと間違ったものの最適化に使わずに済ませてくれます。

Google自身のドキュメントは、これと両立するもっと短いことを言っており、ベンダーが違うことを言ってきたときに握っておく価値があります。そのAI機能に補助リンクとして現れるには、「ページはインデックスされ、スニペット付きでGoogle検索に表示される資格があり、検索の技術要件を満たしている必要があります」。そして「これらの機能に現れるために、新しい機械可読ファイル、AIテキストファイル、マークアップを作る必要はありません。」5 この線より上で売られているものはすべて、自分がどのステージに作用するのか、そしてそこでそれを測った研究はどれかを言えるべきです。

この記事の正直な限界

この診断法は主張をメカニズムで仕分けるものであって、真偽で仕分けるものではありません。正しいステージを名指ししていても誤っている主張はありますし、テストに落ちても、まだ誰もきちんと測っていない本物の何かを描いている主張もありえます。これほど若い分野では、証拠がないことは「ない」ことの弱い証拠にすぎないからです。上の否定のうち2つは単一の研究に乗っており、それはまさにそれらが批判している罪そのものです。schemaの結果は、もともと大量に引用されていたページに対するマッチドコントロール試験1件であり、JavaScriptの結論は2024年12月のログ研究1件です。これらのシステムは月ごとに変わるので、日付の付いたヌル結果は、その日付でのヌル結果です。ここにある6か月より古いものは、動く前に確かめ直してください。

製品が役に立つ場面と、立たない場面

診断法そのものが成果物であり、無料です。直近で受け取ったGEOの助言を5つ取り出し、それぞれの横に作用するステージ番号を書き、ステージを言えないものを消してください。そのうえで残ったものを、まだ勝てていないページで、戻せる小さな実験として走らせ、スクリーンショット1枚ではなく繰り返し実行して測ります。Baviorが助けるのは最後の測定の問題だけです。決まったプロンプト群を5つのエンジンに定期実行し、各回答がどの情報源を引用したかを記録するので、変化は逸話ではなく分布の移動として現れます。引用された情報源が生きた議論スレッドである場合は、あなたが管理するアカウントで返信の下書きを作り、投稿の前にあなたが承認します。GEOの助言をあなたの代わりに監査することはなく、ページを書き換えることもなく、引用や順位を約束することもできません。無料 AI 可視性チェッカー無料 GEO 診断は有料プランなしで使えます。有料プランは月払いで月額 $99 から、年払いなら月額 $79.17 です(2026年8月29日時点)。

出典:すべて2026年8月29日に確認
  1. Kim ら「SAGEO Arena: A Realistic Environment for Evaluating Search-Augmented Generative Engine Optimization」KDD 2026、arXiv:2602.12187。arxiv.org/abs/2602.12187
  2. Aggarwal、Murahari、Rajpurohit、Kalyan、Narasimhan、Deshpande「GEO: Generative Engine Optimization」KDD 2024、arXiv:2311.09735(もとの順位別の相対変化と、キーワード詰め込みの結果)。arxiv.org/abs/2311.09735
  3. 「Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)」2026年7月15日、arXiv:2607.14035(確信度表と、40%の一般化に対する棄却)。arxiv.org/abs/2607.14035
  4. Puerto、Gubri、Green、Oh、Yun「C-SEO Bench: Does Conversational SEO Work?」NeurIPS 2025 Datasets & Benchmarks Track、arXiv:2506.11097。arxiv.org/abs/2506.11097
  5. Google Search Central(一次情報)。「AI features and your website」最終更新2025年12月10日、本記事の2つの引用はいずれもこのページから:developers.google.com/search/docs/appearance/ai-features。「Optimizing your website for generative AI features on Google Search」最終更新2026年7月10日:developers.google.com/search/docs/fundamentals/ai-optimization-guide
  6. 構造化データのマッチドコントロール研究、2026年5月:2025年8月から2026年3月の間にJSON-LDを追加した1,885ページを4,000の対照ページと突き合わせ、前後30日の引用を測定。AI Overviews −4.6%(有意)、他のサーフェスは有意差なし。ベンダー公表につき、本カリキュラムの出典ルールに従い、リンクせず説明のみ。
  7. AIテキストファイルの研究、2026年6月:137,210ドメイン。そうしたファイルの97%がリクエストをゼロ件しか受けておらず、存在しないファイルを探るボットもありませんでした。ベンダー公表につき、本カリキュラムの出典ルールに従い、リンクせず説明のみ。
  8. 最も引用されるドメインの研究、2025年11月:プロンプト230,000件、引用1億件超、2025年7月から10月。ある大規模フォーラムに対するあるエンジンの引用率は1か月のうちにおよそ50ポイント動き、広く引用される40.1%という数字は、合計がおよそ208%になる回答ごとの出現率にたどり着きます。ベンダー公表につき、本カリキュラムの出典ルールに従い、リンクせず説明のみ。
よくある質問

よく聞かれることを、まとめました。

「GEOは可視性を40%高める」は本当ですか?

この分野の2026年の批判的サーベイは、これを一般的な主張としては棄却し、この数字は「特定の構成下で1つの指標に対する相対的な最大値」だとしています。その背後にある結果は、位置調整済みワードカウント、つまり回答の語のうちどれだけがあなたの情報源に帰せられるかを測る指標が19.3から27.2へ上がったというもので、それはGoogleの上位5件の結果を取得してGPT-3.5にその上から書かせる、目的別に作られたエンジンの中での話です。最適化されたページは、最初からその5件に入っていました。これは1つのステージについての本物の測定です。オープンウェブ上のページに書き換えが何をするかの予測ではありません。

schemaマークアップを追加すると、AI検索にもっと引用されますか?

利用できる唯一のマッチドコントロール試験は「増えない」と言っており、エンジン自身のドキュメントも同意しています。その研究は、2025年8月から2026年3月までにJSON-LDを追加した1,885ページを、一度も追加しなかった4,000の対照ページと突き合わせ、前後30日の引用を測定し、AI Overviewの引用が4.6%減り、他のサーフェスには有意な変化がないことを見つけました。GoogleはそのAI機能に現れるために「追加する必要のある特別なschema.org構造化データもありません」と直接述べています。schemaはリッチリザルトと機械可読性の衛生のために出しましょう。AI引用のレバーとして扱ってはいけません。

すでに1位なら、そのページにGEOの書き換えを当てるべきですか?

慎重に。創始論文自身の結果表は、これらの施策が、すでに1位だった情報源に帰せられる回答のシェアを測定できるほど減らすことを示しています。出典の明示は−30.3%、引用文の追加は−22.9%、統計の追加は−20.6%で、5位だった情報源はおよそ倍でした。これらの施策は回答のシェアを下位の情報源へ再配分するので、普遍的な底上げではなく平準化です。まだ勝てていないページでテストし、変更は戻せる大きさにとどめ、1回のビフォーアフターの確認ではなく繰り返し実行して測ってください。

あるGEOの研究が動くに値するかを、どう見分けますか?

4つの問いを順番に。その主張はパイプラインのどのステージに作用しますか。解釈やファンアウトなら、そのステージはあなたのサイトからの入力を受け取らないのでメカニズムがありません。測られたときリトリーバルと再ランキングは動いていましたか、それとも文書は前もってモデルのコンテキストに置かれていましたか。分母と日付は何ですか。回答あたりのシェアと引用あたりのシェアは数十ポイント違い、これらのシステムは月ごとに変わるからです。そしてその効果は、広く採用されても生き残りますか。NeurIPS 2025のベンチマークは、同じ施策を採る主体が増えるほど利得が下がることを見つけ、この問題を「混雑したゼロサム」と呼んでいます。

Bavior 編集部

Reddit マーケティングと AI 検索可視性に関する Bavior のコンテンツを調査・管理しているチームです。記事中のすべての数値には出典と確認日を明記しており、アフィリエイトリンクは一切使用していません。

数値に誤りを見つけたらお知らせください。再確認します: support@bavior.com

ステージを言えないなら、その施策は捨てましょう。
そのうえで、実際に何が動いたのかを測りましょう。

無料トライアルを開始