ホーム/GEO を学ぶ/ステージ 3
AI検索の仕組み · ステージ 3

AI 検索のリトリーバル段階では何が起きているのか?

リトリーバルは、ページが品質を判断される前に競争から降りてしまう場所です。そしてこの分野でいちばん強い証拠があるのもここです。下流のすべては、ここで上限が決まります。

このページの内容
この記事をシェア
X でシェア LinkedIn でシェア
短い答え

リトリーバルとは、生成された検索クエリのそれぞれがインデックスまたはライブフェッチャーに投げられ、候補文書を返してくる段階です。これはランキング要因ではなくゲートです。インデックスされていない、フェッチできない、あるいはエンジンが発行したどのクエリにも関連しないページは、どれだけうまく書けていても、以降のすべての段階でゼロ点になります。2026年のプリプリントによれば、AI の回答で引用された URL の 27.1% はそもそもスクレイピングできませんでした。アクセス不能、削除済み、または非テキストだったためです。7

重要ポイント
  • 取得可能性が下流のすべてに上限をかけます。候補にならないページは、選択でも統合でも確率がゼロです。文章がどれだけ良くても変わりません。
  • ページが脱落する箇所は 6 つあります。インデックス、robots.txt のトークン、レンダラー、切れた URL、ページの手前に立つゲート、そして実際に発行されたサブクエリとの関連性です。
  • 学習用クローラーと検索用クローラーは、Google、OpenAI、Anthropic、Apple のいずれでも別々のトークンとして文書化されています。学習用をブロックしても何も変わりません。ワイルドカードによる一括の Disallow は、そのすべてからあなたを消します。
  • 回答となる本文は最初の HTML レスポンスに含めてください。従来型の AI クローラーによる JavaScript 実行について公開された唯一の測定は、実行を検出していません。追試も出ていません。
定義

リトリーバル段階では何が起きるのか?

リトリーバルは、ファンアウトが生成した各クエリを受け取り、それぞれに候補文書の集合を返します。取得元は、あらかじめ構築されたインデックスか、質問された時点でのライブフェッチのどちらかです。仕組みに特別なところはありません。これは検索であり、その言葉が持つ普通の帰結をすべて伴います。Google は自社の AI サーフェスについてまさにそう述べています。「Google 検索における生成 AI 機能は、当社の中核となる検索ランキングと品質のシステムに根ざしています」10。そして補足リンクの対象になるには、ページは「インデックスされ、スニペット付きで Google 検索に表示される資格があり、検索の技術要件を満たしている」必要があります。1

リトリーバルには 2 つのパターンが併存し、壊れ方が異なります。インデックス型では、重要だったフェッチはもっと前、場合によっては数週間前にクローラーによって行われています。エンジンが持っているあなたのページは、そのクローラーが見たバージョンです。ライブ型では、誰かが質問したその瞬間にフェッチャーが URL を取りに行きます。鮮度は即時になりますが、応答の遅さ、ボット対策チャレンジ、403 が致命傷になります。インデックス型ではそうはなりません。対象となるシステムの多くは両方を動かしており、user-agent トークンも別です。ここに何本のクエリが届くかを決めるのは、ひとつ前の段階です。全体像はAI検索の仕組み にあります。

失敗の形

ページはどこで静かに脱落するのか?

ページがリトリーバルから脱落する箇所は、はっきり分けて 6 つあります。インデックス、robots.txt のトークン、レンダラー、URL そのもの、その手前に立つゲート、そしてエンジンが実際に発行したサブクエリとの関連性です。

この 6 つはどれもアナリティクスには映りません。一度もリトリーバルされなかったページは、欠けているはずの表示回数すら生まないからです。

01

インデックスに入っていない

Google が明示している条件は、ページがインデックスされ、スニペット表示の資格があることです。noindex、max-snippet ディレクティブ、別を指す canonical のいずれかがあれば、他が評価される前にページは検討対象から外れます。

02

ブロックするボットを間違えている

主要ベンダーはいずれも、学習用と検索用で別々のトークンを文書化しています。検索用トークンをブロックすると、そのエンジンの回答からあなたは消えます。学習用トークンのブロックでは通常そうなりませんが、文書化された例外が 1 つあります。Google-Extended は現在、Gemini Apps と Vertex AI でのグラウンディングも制御します。これを Disallow にするとその面は失われますが、Google 検索と AI Overviews には影響しません。ワイルドカードによる一括の Disallow は、両方をまとめて落とします。

03

本文が JavaScript の後にしか存在しない

従来型の AI クローラーについて公開された唯一の測定では、JavaScript ファイルは取得するが実行はしないという結果でした。Google、Bing、Applebot はレンダリングします。他のいくつかはしていないようです。リスクは全体一律ではなく、ばらつきがあります。

04

URL が切れている、または移動した

あるインフラ事業者の 2024 年 12 月のログ調査では、GPTBot はフェッチの 34.82% を 404 に、14.36% をリダイレクトに費やし、ClaudeBot は 34.16% を 404 に費やしていました。Googlebot はそれぞれ 8.22% と 1.49% です。6

05

手前にゲートが立っている

ログインウォール、同意画面、ボット対策チャレンジ、厳しすぎるレート制限は、いずれもフェッチを終わらせます。画像、動画、フェッチャーが解析しない PDF の中にしか存在しない内容も同じです。

06

聞かれたことのどれにも関連しない

いちばん静かな失敗です。完璧にインデックスされ、完璧に書かれたページでも、ファンアウトが実際に発行したクエリのどれにも一致しないことがあります。その場合、そのページはリトリーバルで落とされたのではありません。最初から候補ですらないのです。

この母集団の大きさは、反対側から測れます。批判的サーベイ経由で報告された 2026年のプリプリントは、AI の回答ですでに引用されている URL の 27.1% がスクレイピングできなかったと述べています。アクセス不能、削除済み、非テキストのいずれかでした。7 分母は注意して読んでください。これは、第三者の研究者が引用された URL を取得できたかどうかを測っており、それを引用したエンジンが取得できたかどうかではありません。それでもこれは、引用されるだけの水準にあったページの失敗率です。そこまで届かなかったページの失敗率は必然的にもっと高く、誰も測っていません。

上限

なぜ取得可能性はランキング要因ではなく上限なのか?

各段階が掛け算だからです。候補集合に入っていないページは、選択でも統合でも確率がゼロです。下流の品質をどれだけ高めても、ゼロには何も掛かりません。この分野でいちばん強い実験結果が、文章ではなく位置と存在についてのものなのは、そのためです。NeurIPS 2025 のベンチマークは、6 つのドメイン、1,900 件超のクエリ、16,000 件の文書で 10 種類の会話型 SEO 手法を検証しました。小売ドメインでは、ソースをコンテキストの 1 番目の位置に移すと引用順位が平均 2.77 位上がり、検証した中で最良のコンテンツ手法は 0.36 位でした。有意に正だったのは 54 ケース中 3 ケースだけです。8

2026年の批判的サーベイは、同じ境界に明示的な評価を与えています。「クエリと文書の関連性、そしてコンテキスト内の位置が主要な決定要因である」は確信度、「ホワイトハットの施策が複数のエンジンにわたって自然な発見されやすさを持続的に改善する」はとされています。9 どこに労力を割くべきかの順位として読めば、答えは明快です。ゲートを直してから、その先を磨いてください。

robots.txt

実際に許可すべきクローラーはどれか?

主要ベンダーはいずれも、学習データを集めるボットと検索インデックスを作るボットを文書上で分けています。この 2 つを混同することが、自分で招くリトリーバル失敗として最も多いものです。

ベンダー学習 / グラウンディング用トークン検索インデックス用トークン前者をブロックすると回答から消えますか?
GoogleGoogle-ExtendedGooglebotいいえ。AI Overviews は検索インデックスを使います1
OpenAIGPTBotOAI-SearchBotいいえ。片方を許可し、もう片方を Disallow にする方法がドキュメントに書かれています2
AnthropicClaudeBotClaude-SearchBotいいえ。別々のトークンとして文書化されています3
AppleApplebot-ExtendedApplebotいいえ。前者を Disallow にしても検索への掲載は可能です4
Perplexity文書化なしPerplexityBotユーザー起点のフェッチャーは robots.txt を通常無視すると同社のドキュメントに書かれています5

4 つの分割をそれぞれ個別に確認し、思い込みではなく実際のフェッチで検証してください。よくある 2 つの誤りは、向きが正反対だからです。AI の回答に出ないつもりで学習用トークンを Disallow にしても、何も達成できません。一方、何年も前に別の理由で書かれたワイルドカードの一括 Disallow は、AI 検索ボットを静かに一度に全部消します。効かないものも押さえておいてください。Google のドキュメントはこう述べています。「Google 検索(その生成 AI 機能を含む)に表示されるために、新しい機械可読ファイル、AI テキストファイル、マークアップ、Markdown を用意する必要はありません。Google 検索自体がそれらを使わないからです」10

レンダリング

エンジンはあなたの JavaScript をレンダリングするのか?

エンジン次第です。そして正直な要約は、よく繰り返される話よりも狭いものです。Google はレンダリングします。ドキュメントには「ブロックされていない限り、Google は JavaScript 内のコンテンツを処理できます」とあり、その AI サーフェスは同じレンダリング済みインデックスの上で動いています。10 Apple もレンダリングします。「Applebot はブラウザ内でウェブサイトのコンテンツをレンダリングすることがあります。javascript、CSS、その他のリソースが robots.txt でブロックされていると、コンテンツを正しくレンダリングできないことがあります」4。エージェント型ブラウザはレンダリングします。ブラウザだからです。

それ以外については、公開された測定はちょうど 1 件だけです。2024 年 12 月、あるインフラ事業者が自社のログデータを分析し、主要な AI クローラーはいずれも JavaScript をレンダリングしないと結論づけました。6 それ以降、追試も反証となる測定も公開されていません。実行を検出した方法は説明されておらず、レンダリングの有無を文書化している AI ベンダーもありません。ですから擁護できる言い方は「2024 年 12 月の唯一の公開測定では実行が検出されなかった」であって、「2026 年の AI クローラーは JavaScript をレンダリングできない」ではありません。

いずれにせよ、対処は安く済むので、この論争に決着をつける必要はありません。本文が最初の HTML レスポンスに入っていれば、どのエンジンでもこの問いは起きません。

ランキング

何が取得されるかは今もランキングが決めるのか?

ランキングは今も、引用されるかどうかの単独の予測因子としては最強です。そして、それだけでは足りなくなりました。Findings of ACL 2026 に掲載された Google AI Overviews の監査は、4,706 件のクエリを対象に 2025 年 9 月収集のデータで行われ、AI Overviews が参照するドメインの 53% がオーガニックの上位 10 件に入っておらず、27% は上位 100 件にも入っていないことを示しました。11 55,393 件のクエリを 2026 年 3 月 13 日から 4 月 21 日に収集したプリプリントは、サンプルがおよそ 12 倍、時期は半年後で、AI Overview の参照ドメインの 29.8% が対応する 1 ページ目に出てこないと報告しています。13 どちらか一方の点推定として引くのではなく、2 つの収集期間を明記したうえで、およそ 30% から 53% という幅として引用してください。動詞も区別してください。Kirsten らが測っているのはシステムが参照するドメインであり、引用するドメインとは同じではありません。

SIGIR 2026 の 11,500 件のクエリを用いた研究は、Google のオーガニック、AI Overviews、Gemini の間で URL 単位の Jaccard 類似度を 0.11–0.18 と測定しました。12 仕組みはファンアウトです。リトリーバルはサブクエリごとに走るので、目に見える質問では順位がつかないページが、その一部分に対しては的確に順位を得られます。

重なりの割合を示す単独の数字は、上のものも含めて疑ってかかってください。この数字は、ほとんど明示されない分母に完全に依存するからです。「AI の回答のうち、上位 10 件の URL を少なくとも 1 つ含むものの割合」と「個々の引用のうち上位 10 件から来たものの割合」は別の問いです。2025 年から 2026 年に公表された数字は、どちらを問うたか、いつか、どのサンプルかによって、およそ 6 分の 1 から 4 分の 3 超まで開きがあります。分母と日付のない数字は測定ではありません。擁護できる総合判断は方向性です。上位 10 位のランキングは高頻度の引用を獲得し、ロングテールの大きく、そして増えつつある部分は、1 ページ目にまったく入っていないページから来ています。

この記事の正直な限界

ここで最も引用される 2 つの数字が、そのまま最も弱い環でもあります。27.1% がスクレイピングできないという数字はプリプリントのもので、査読を経ていません。しかも測っているのは、すでに引用された URL であって一般のウェブではありません。JavaScript の結論は、2024 年 12 月の単一のログ調査に依拠しています。その実行検出の方法は別に公開されたもので、片側しか見えません。レンダリング時のビーコンが届かないという事実だけでは、レンダリングしないクローラーと、ビーコンがブロックされたクローラーを区別できません。20 か月たっても追試はなく、ベンダーの文書も賛否どちらの記述もありません。その間に製品は大きく変わりました。どちらの主張も決着していません。この記事で堅いのは、一次情報である robots.txt のトークン分割と、Google 自身の掲載資格の記述です。これらはシステムを運用している企業から出ているからです。

製品が役に立つ場面と、立たない場面

リトリーバルの監査はすべて無料で、1 時間ほどで終わります。重要な URL をコマンドラインの素のリクエストで取得し、回答となる本文が JavaScript なしの HTML に入っていることを確認します。robots.txt を上の 4 つのトークン分割と突き合わせます。ページがインデックスされ、スニペット表示の資格があることを確認します。自社サイトをクロールして 404 とリダイレクトチェーンを洗い出します。AI クローラーはこれらの追跡が Googlebot よりずっと苦手です。どれにもツールは要りませんし、修正を代わりにやってくれるツールもありません。Bavior が扱うのは、この次の段階です。決まったプロンプト群を 5 つのエンジンに定期実行し、各回答がどのソースを引用したかを記録します。これにより、リトリーバルの修正で誰が出てくるかが変わったかが分かります。引用されたソースが進行中の議論スレッドである場合は、あなたが管理するアカウントで返信を下書きします。投稿の前に承認するのはあなたです。サイトのクロールはしませんし、robots.txt も編集しません。ブロックされたページを取得可能にすることもできません。無料の AI 可視性チェック無料の GEO 監査は有料プランなしで使えます。有料プランは月払いで月額 $99 から、年払いなら月額 $79.17 です(2026年8月29日時点)。

出典、すべて2026年8月29日に確認
  1. Google Search Central「AI features and your website」2025 年 12 月 10 日更新(掲載資格、Google-Extended、スニペット制御。一次情報):developers.google.com/search/docs/appearance/ai-features
  2. OpenAI、クローラーとボットのドキュメント(GPTBot、OAI-SearchBot、ChatGPT-User。一次情報):developers.openai.com/api/docs/bots
  3. Anthropic「Does Anthropic crawl data from the web?」(ClaudeBot、Claude-SearchBot、Claude-User。一次情報):support.claude.com/en/articles/8896518
  4. Apple「About Applebot」(Applebot、Applebot-Extended、ブラウザでのレンダリング。一次情報):support.apple.com/en-us/119829
  5. Perplexity、ボットのドキュメント(PerplexityBot、Perplexity-User。一次情報):docs.perplexity.ai/guides/bots
  6. Zecchini、Moore、Ubl、Siddle「The rise of the AI crawler」Vercel、2024 年 12 月 17 日(インフラ事業者の一次ログデータ):vercel.com/blog/the-rise-of-the-ai-crawler
  7. Allaham & Diakopoulos、2026年。AI の回答で引用された URL の 27.1% がスクレイピングできなかった(プリプリント。出典 9 の批判的サーベイ経由で報告)
  8. Puerto、Gubri、Green、Oh、Yun「C-SEO Bench: Does Conversational SEO Work?」NeurIPS 2025 Datasets & Benchmarks Track、arXiv:2506.11097:arxiv.org/abs/2506.11097
  9. 「Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)」2026 年 7 月 15 日、arXiv:2607.14035(サーベイのプリプリント):arxiv.org/abs/2607.14035
  10. Google Search Central「Google’s Guide to Optimizing for Generative AI Features on Google Search」2026 年 7 月 10 日更新(「根ざしています」の一文、JavaScript の処理、AI テキストファイルは不要。一次情報):developers.google.com/search/docs/fundamentals/ai-optimization-guide
  11. Kirsten ほか、Findings of ACL 2026。Google AI Overviews の 4,706 件クエリ監査、データは 2025 年 9 月に米国とドイツで収集。原文は「on average 53% (27%) of domains that AIO consults are not contained in top-10 (top-100) Organic search results」:aclanthology.org/2026.findings-acl.526
  12. Grossman ほか、SIGIR 2026。11,500 件のクエリ。Google のオーガニック、AI Overviews、Gemini の間の URL 単位 Jaccard は 0.11–0.18:arxiv.org/abs/2604.27790
  13. Xu、Iqbal & Montgomery、2026年。55,393 件のトレンドクエリを 2026 年 3 月 13 日から 4 月 21 日に収集。原文は「29.8% of AIO reference domains do not appear anywhere on the corresponding first page」(プリプリント):arxiv.org/abs/2605.14021
よくある質問

よく聞かれることを、まとめました。

GPTBot をブロックすると、ChatGPT の回答から消えますか?

いいえ。GPTBot と OAI-SearchBot は別々に文書化された別のトークンで、検索に基づく回答への掲載を左右するのは検索インデックス用のクローラーです。OpenAI 自身のボットのドキュメントには、検索結果に出るために OAI-SearchBot を許可しつつ GPTBot を Disallow にする方法が書かれています。同じ分割は Google(Google-Extended と Googlebot)、Anthropic(ClaudeBot と Claude-SearchBot)、Apple(Applebot-Extended と Applebot)にもあります。すべての AI 回答から一度に消えるのは、ワイルドカードによる一括の Disallow です。これは意図して選ばれたというより、古い robots.txt から引き継がれていることがほとんどです。

AI の回答に出るには、サイトにサーバーサイドレンダリングが必要ですか?

エンジン次第ですが、本文を最初の HTML に含めればどのエンジンでもこの問いは消えます。Google は「ブロックされていない限り JavaScript 内のコンテンツを処理できる」と述べており、Apple は Applebot がブラウザ内でレンダリングすると文書化しています。エージェント型ブラウザはブラウザなのでレンダリングします。従来型の AI クローラーについては、公開された唯一の測定、つまりあるインフラ事業者の 2024 年 12 月のログ調査が、JavaScript ファイルを取得するが実行はしないと報告しています。同記事の 5億6,900万回という GPTBot の数字は月間のリクエスト数であり、レンダリング検証のサンプルではありません。後者はその記事に書かれていません。追試も反証もされていないので、決着した事実ではなく、現時点で最良の証拠として扱ってください。

AI 検索に引用されるには、今も Google で順位が必要ですか?

ランキングは今も、引用されるかどうかの単独の予測因子としては最強ですが、それだけでは足りません。Findings of ACL 2026 に掲載された Google AI Overviews の 4,706 件クエリ監査によると、AI Overviews が参照するドメインのうち平均 53% はそのクエリのオーガニック上位 10 件に出てこず、27% は上位 100 件にも入っていません。仕組みはクエリファンアウトです。リトリーバルはサブクエリごとに走るので、質問の一部分では取得されながら、質問全体では順位がつかないことがあります。上位 10 位のランキングは高頻度の引用を取るもの、サブ質問のカバレッジはロングテールを取るものとして扱ってください。

インデックスされていて、よく書けているページが、それでも引用されないのはなぜですか?

最も多い理由は、エンジンが実際に発行したクエリのどれにも一致しなかったことです。リトリーバルは元の質問単位ではなく、ファンアウトのサブクエリ単位で走ります。ですからページがインデックスされ、速く、よく書けていて、トピックにも完全に関連していながら、検索されたどれの候補にもならないことがあります。もう 1 つよくある原因は、品質の判断ではなく取得の失敗です。2026年のプリプリントは、AI の回答がすでに引用していた URL の 27.1% がまったくスクレイピングできなかったと報告しています。アクセス不能、削除済み、非テキストのいずれかでした。どちらの失敗もアナリティクスには何のシグナルも残しません。だから居座り続けます。

Bavior 編集部

Reddit マーケティングと AI 検索可視性に関する Bavior のコンテンツを調査・管理しているチームです。記事中のすべての数値には出典と確認日を明記しており、アフィリエイトリンクは一切使用していません。

数値に誤りを見つけたらお知らせください。再確認します: support@bavior.com

取得可能性が上限です。
自分の上限がどこにあるかを確かめてください。

無料トライアルを開始