ホーム/GEO を学ぶ/ペイウォールとブロック
テクニカルGEO · アクセス制御

ペイウォールとクローラーブロックは、あなたをAIの答えから締め出せるのか?

直感で出す答えは、両方向とも間違っています。クローラーをブロックしても確実に答えから外れるわけではなく、完全に開放していても確実に答えに入れるわけではありません。

このページの内容
この記事をシェア
X でシェア LinkedIn でシェア
短い答え

robots.txtのdisallowは1つの要請です。文書化されたクローラーはそれを守り、ユーザーが起点となるフェッチはしばしば守りません。つまりそれが決めるのは、誰があなたをフェッチしてよいかであって、あなたについて書かれうるかどうかではありません。ですからアクセス制御は、何と引き換えにするのかというビジネス上の判断であり、どちらの方向にも結果を保証するスイッチではありません。Tow Centerが8つの生成AI検索ツールに対して1,600件のクエリで行ったテストでは、ある有料版アシスタントが、本来アクセスできないはずの記事から取った90件の抜粋のうち3分の1近くを正しく特定しました。1

重要ポイント
  • 2社は、ユーザー起点のフェッチャーがrobots.txtを無視する場合があると文書に書いています。3社目は、自社のボットはすべて守ると書いています。1つのディレクティブに、3つの意味があります。
  • ブロックしても、要約されることは止まりません。転載コピー、第三者による報道、そして普通のChromeセッションを操作するエージェントが、その周りを回っていきます。
  • ブロックが無意味というわけでもありません。オプトアウトすると自社の検索回答から外れると各社が文書に書いており、ブロックされたあとの答えは、消えるのではなく曖昧になったと観測されています。
  • 一部のブロックは、あなたが残したかったものと結びついています。検索インデックス、あなたのスニペット、あるいはあなたの意思表示を載せたファイルをベンダーが読む能力です。
  • ブロックが引用にどれだけの代償を払わせるかについて、このカリキュラムの出典基準を満たす公表された測定はありません。つまり取引の大きさは分かっていません。
定義

robots.txtのdisallowは実際に何をするのか

それはフェッチャーに対して、あるパスを要求しないでほしいと頼むものです。文書化された行儀のよいクローラーはその要請を守りますが、これは一度もアクセス制御であったことがありません。ファイルは公開されていて、実行は完全に相手側で起きます。そのファイルの最も広く使われているマネージド版を提供しているインフラ事業者は、自社のより新しいシグナル方式についてまさにそう述べています。コンテンツシグナルは「選好を表明するものであり、スクレイピングに対する技術的な対抗手段ではありません。単に無視する企業もあるでしょう」。4

結果の大半を決める分かれ目は、学習と検索の違いではありません。そちらはリトリーバルのステージが扱います。分かれ目は、スケジュールされたクロールと、誰かが何かを求めたから起きたフェッチとの違いであり、この境界でベンダー各社は自社の文書の中で互いに矛盾しています。以下の引用はすべて、2026年8月30日にベンダーの公開ページと突き合わせて確認しました。

人が起点のフェッチトークンrobots.txtについてベンダーが文書に書いていること
OpenAIChatGPT-User「これらの動作はユーザーが起点であるため、robots.txtのルールは適用されない場合があります」5
PerplexityPerplexity-User「ユーザーがフェッチを要求したものであるため、このフェッチャーは一般にrobots.txtのルールを無視します」7
AnthropicClaude-User同社のボットは「robots.txt内の業界標準ディレクティブを守ることで『クロールしないで』というシグナルを尊重します」6
Google専用トークンなしGooglebot向けディレクティブが、AI機能を含む検索に対する明示された制御手段8
エージェント型ブラウザなしクローラーではありません。そのエージェントは「標準のChromeブラウザを使う人と見分けがつきません」2

最後の行は二度読んでください。エージェント型ブラウザは、礼儀正しいuser agentを名乗るクローラーではなく、人が操作しているブラウザです。それに向けたディレクティブは存在せず、そのトラフィックパターンをブロックすることはChromeをブロックすることを意味します。

証拠

ブロックしている発行元がなぜ引用されるのか

その答えにあなたのページが必要ないからです。2025年3月、Tow Centerは8つの生成AI検索ツールに対して1,600件のクエリを実行し、抜粋を貼り付けて記事名、発行元、日付、URLを答えさせました。「プラットフォームは、意図的にクローラーをブロックしていた発行元から情報を取得していた」という見出しの下で、あるアシスタントの無料版は、ペイウォールの内側にあるNational Geographicの記事から取った10件の抜粋をすべて正しく特定しました。この発行元は同社のクローラーをdisallowしており、同社との関係もありませんでした。1

ブロックを回避する経路は3つあり、争点になっているのは3つ目だけです。1つ目は転載です。USA Todayはあるアシスタントのクローラーをブロックしていますが、そのアシスタントはYahoo Newsが再掲した同じ記事のバージョンを引用しました。2つ目は第三者による報道で、あるエージェントが発行元に直接触れようとしないときに使った代替手段です。「その記事に関するツイート、転載版、他媒体での引用、ウェブ上の関連報道をもとにした合成的な要約」でした。2 3つ目は不遵守です。2025年8月4日、Cloudflareは、robots.txtですべてをdisallowした、新規でインデックスされたことのないドメインを登録したと報告し、それでもあるアシスタントが、そのベンダーの公表アドレス範囲外にある汎用のChrome user agentから、それらのドメインについて詳細な内容を返したと述べました。Cloudflareは同ベンダーを検証済みボットの一覧から外し、ベンダーは翌日ステルスクロールを否定し、この対立は未解決のままです。3

その要約こそ覚えておく価値のある一文です。「検索結果での可視性を望む発行元はそれを得られておらず、オプトアウトを望む側のコンテンツは意思に反して表示され続けていた」。1 1つのファイルは、どちらの失敗もきれいには制御しません。

ペイウォール

ペイウォールは締め出すのか、招き入れるのか

それはあなたが作ったのがどちらの種類かによります。そして多くの発行元が作ったのは、機械を止めない方の種類でした。クライアントサイドのオーバーレイは記事全文をブラウザに送り、購読を促す表示でそれを覆います。Tow Centerは、MIT Technology Review、National Geographic、Philadelphia Inquirerがこれを使っていると名指しし、「このコンテンツは人間には見えないが、AtlasやCometのようなAIエージェントは今でも読める」と述べています。同センターがWall Street JournalとBloombergに帰しているサーバーサイドのペイウォールは、認証情報が確認されるまでテキストを一切送りません。2 どちらも、購読している読者がそのページにエージェントを向けることは止められません。

同センターの2025年10月の実演は、2つの失敗の方向がぶつかる場面を示した、公表されたなかで最もきれいな事例です。MIT Technology Reviewの9,000語の購読者限定記事の全文を求められて、2つのエージェント型ブラウザはそれを返しました。同じ2社の標準のチャットインターフェースで同じプロンプトを出すと拒否されました。同誌が両社のクローラーをブロックしていたからです。ブロックはクローラーには効き、ブラウザには無関係でした。

インデックス登録の側には、誰も欺かない、文書化された答えがあります。購読およびペイウォールコンテンツに関するGoogleの構造化データガイドが存在するのは、Google自身の言葉によれば、そのマークアップが「スパムポリシーに違反するクローキングという行為と、ペイウォールコンテンツとをGoogleが区別する助けになる」からです。そしてガイドは冒頭で適用範囲を狭めています。「このガイドは、クロールおよびインデックス登録を望むコンテンツにのみ適用されます」。9 課金している部分をisAccessibleForFreeとhasPartで示すことが、料金を取り続けながらページが対象であり続けるための方法です。そのマークアップなしに、読者から隠しているテキストをクローラーに配信することが、このポリシーが言うクローキングであり、このカリキュラムがそれを手渡すことはありません。

取引

ブロックは実際に何を買うのか

実在するものを買います。ただし、議論のどちらの側が主張するよりも小さいものです。遵守する側の経路では、ブロックは言葉どおりに働きます。OpenAIは「OAI-SearchBotをオプトアウトしたサイトはChatGPTの検索回答に表示されないが、ナビゲーションリンクとしては表示されうる」と文書に書いています。5 AnthropicはClaude-SearchBotを無効にすると「当社のシステムが検索最適化のためにあなたのコンテンツをインデックスすることを防ぎ、その結果、ユーザーの検索結果におけるサイトの可視性と正確性が下がる可能性があります」と書いています。6 2つ目はよく読んでください。あなたが抜けたあと、あなたに関する自社の正確性が下がるかもしれない、とベンダー自身が言っているのです。

遵守しない側の経路については、実際に効いたブロックが何を変えたかについての公表された観測が1件あります。Cloudflareは、ステルスクローラーをブロックしたあと、そのアシスタントは他のウェブサイトを含む別のデータソースに切り替え、「これらの答えは具体性に欠け、元のコンテンツの詳細を欠いていた」と報告しています。3 これがこの取引の正直な形です。ブロックは、あなたについて語られること自体を止めるのではなく、語られる内容の質を落とす傾向があります。

アクセスを契約と引き換えにしても、正確性は買えません。Tow Centerは調査結果の1つとして「ニュース提供元とのコンテンツライセンス契約は、チャットボットの回答における正確な引用を何ら保証しなかった」を挙げています。その例は、OpenAIの検索クローラーを許可し、同社とのパートナーシップの内側にいる発行元であり、その抜粋をアシスタントが正しく特定できたのは10回に1回でした。1 アクセスは正確な帰属の前提条件であって、その原因ではありません。

副作用

意図より高くつくブロックはどれか

3つの結びつきが、狭い意図を広い損失に変えます。Googleには、AIだけを対象とするディレクティブがありません。「AIは検索に組み込まれており、検索の機能の仕方に不可分です。だからこそ、Googlebot向けのrobots.txtディレクティブが、自サイトが検索のためにどうクロールされるかをサイト所有者が管理するための制御手段なのです」。そこで挙げられているより細かい制御、nosnippet、data-nosnippet、max-snippet、noindexは、いずれも通常の検索結果も削ります。そしてGoogle-Extendedが管轄するのは、Googleの他のシステムにおける学習とグラウンディングであって、検索ではありません。8 Tow Centerのサンプルのうち公開クローラーを持つツールで、20の発行元のどこからもブロックされていなかったものが1つあり、研究者はその理由を、そのツールが一般的な検索エンジンとクローラーを共有していることに求めました。ブロックすればそのインデックスから抜けることになるからです。1

3つ目は、望んだ効果を反転させます。Anthropicは「Anthropicのボットが稼働するIPアドレスをブロックするといった代替手段は、正しく機能しない場合があり、オプトアウトを継続的に保証するものでもありません。そうすることで当社があなたのrobots.txtファイルを読む能力が妨げられるためです」と文書に書いています。6 クローラーを狙ったファイアウォールのルールは、フェッチはされるのに意思は届かないという状態を生みかねません。あなたの意思表示を載せたファイルこそ、あなたがブロックしたものだからです。

タイミングは、前後比較の読み取りの大半を静かに台無しにします。OpenAIは「サイトのrobots.txt更新から当社のシステムが調整するまで約24時間かかることがあります」と述べています。Perplexityは変更の反映に最大24時間かかる場合があるとしています。Googleはプレビューの制御について「数日から数か月までさまざまです」と述べています。578 ブロックはスイッチではありませんし、ブロック解除もスイッチではありません。

判断

どう決め、何を書き残すのか

ファイルに触る前に、自分が買おうとしている結果に名前をつけてください。チームがたいてい思い浮かべる4つの結果のうち、2つは達成でき、1つは部分的で、1つはメニューにありません。

クロール負荷の低減は達成でき、自分のログで測れます。交渉上の立場も達成でき、これは技術ではなく商業上の判断です。帰属のない要約を減らすことは部分的にしか達成できません。上の証拠が言っているのは、要約は止まるのではなく劣化するということだからです。答えがあなたについて何を言うかを制御することはメニューになく、その理由が上のすべてです。あるページを本当に読ませてはいけないなら、ディレクティブではなく認証を与えてください。

許可か拒否かより細かいものが欲しければ、いまは語彙があります。Content Signals Policyはrobots.txtにsearch、ai-input、ai-trainを追加し、searchを「検索インデックスを構築し、検索結果を提供すること」と定義したうえで、「searchにはAIが生成した検索要約の提供は含まれない」と述べています。4 その作成者自身の説明によれば、これは選好を表明するものであって、強制するものではありません。そのうえで4つを書き残してください。選んだ結果、触ったすべてのトークン、日付、そして各ベンダーが文書に書いている遅れです。後ろの2つがなければ、クロールの遅れを効果として読んでしまいます。

この記事が答えられないこと

ブロックが引用にどれだけの代償を払わせるのかについて、きれいな測定を公表した人は誰もいません。2026年のあいだに、ブロックしている発行元も引用の大半を維持していると主張するベンダー分析が出てきましたが、その目立つ数字は互いに食い違っており、対応づけた設計を明示したものはなく、このカリキュラムの出典基準を満たすものもありません。ですからそこからの数字はここには出しません。基準を満たす研究のほうは、この問いのために作られたものではありません。Tow Centerが20の発行元を選んだのはAIアクセスへの姿勢がさまざまだったからで、測ったのは引用の量ではなく引用の正確性であり、対応づけた対照群も前後比較もありません。ブロックされたあとの答えが「具体性に欠ける」ものになったというCloudflareの記述は、セキュリティ調査のなかの定性的な観測であり、その中心にある主張は係争中です。さらに2つ分かっていません。ここで述べたエージェント型ブラウザの挙動が、毎週出荷される製品のなかで生き残るかどうか。そして、あなたがブロックする前に取り込まれたコンテンツを、エンジンがどう扱うのか。この取引の方向は十分に裏づけられている、その大きさは未測定である、と扱ってください(2026年8月30日確認)。

プロダクトが役立つところ、役立たないところ

この判断にソフトウェアは1つも要りません。各ベンダーが文書に書いているトークンと突き合わせて自分のrobots.txtを読むのは20分、サーバーが実際に何を返すかの確認はトークンごとに1回のフェッチ、そしてクローラーログの読み方が、本当に誰が来たのかを教えてくれます。何と引き換えにするのかは、売上を持っている人との会話です。Baviorはあなたのrobots.txtを編集せず、ペイウォールを管理せず、ブロックされたページをフェッチ可能にすることもできず、ブロックが何を失わせたかも教えられません。その反事実は誰のデータにも存在しないからです。ツールにできるのは測定の側です。Baviorは決まったプロンプトセットを5つのエンジンに定期実行し、各回答がどのソースを引用したかを記録します。ファイルを変えたあと、同じプロンプトがあなたではなく再販業者の一覧を引用し始めたことに気づけるのはそのためです。引用されたソースが進行中の議論スレッドである場合は、あなたが管理するアカウントで返信を下書きします。投稿の前に承認するのはあなたです。無料 AI 可視性チェッカー無料 GEO 診断は有料プランなしで使えます。有料プランは月払いで月額 $99 から、年払いなら月額 $79.17 です(2026年8月30日時点)。

出典、すべて2026年8月30日に確認
  1. Jaźwińska、Chandrasekar、Tow Center「AI Search Has a Citation Problem」2025年3月6日(8つのツール、20の発行元、1,600件のクエリ):cjr.org/tow_center
  2. Chandrasekar、Jaźwińska、Tow Center「How AI Browsers Sneak Past Blockers and Paywalls」2025年10月30日(エージェント型ブラウザとペイウォールの種類):cjr.org/analysis
  3. Corral、Singhal、Mitchell、Tatoris、Cloudflare「Perplexity is using stealth, undeclared crawlers to evade website no-crawl directives」2025年8月4日(同ベンダーによる2025年8月5日の否定はリンクしていません):blog.cloudflare.com
  4. Allen、Cloudflare「Giving users choice with Cloudflare’s new Content Signals Policy」2025年9月24日:blog.cloudflare.com/content-signals-policy
  5. OpenAI「Overview of OpenAI Crawlers」(OAI-SearchBot、ChatGPT-User、約24時間の反映時間、一次情報):developers.openai.com/api/docs/bots
  6. Anthropic「Does Anthropic crawl data from the web, and how can site owners block the crawler?」2026年4月7日更新(Claude-User、Claude-SearchBot、IPブロック、一次情報):support.claude.com/en/articles/8896518
  7. Perplexity「Perplexity Crawlers」(Perplexity-User、24時間の反映時間、一次情報):docs.perplexity.ai/guides/bots
  8. Google Search Central「AI features and your website」2025年12月10日最終更新(Googlebotによる制御の記述、スニペット制御、再クロールの遅れ):developers.google.com/search/docs/appearance/ai-features
  9. Google Search Central「Structured data for subscription and paywalled content (CreativeWork)」2025年12月10日最終更新(isAccessibleForFree、hasPart、クローキングとの区別):developers.google.com/search/docs/appearance/structured-data/paywalled-content
よくある質問

よく聞かれることを、まとめました。

AIクローラーをすべてブロックしたら、AIの答えから消えますか?

消えません。遵守する側の経路では確かに抜けます。OpenAIは、OAI-SearchBotをオプトアウトしたサイトはChatGPTの検索回答に表示されないと文書に書いています。残るのは、あなたのページを必要としないものすべてです。Tow Centerは実際にそれを見ています。USA Todayにブロックされていたツールが、代わりにYahoo Newsが再掲した同じ記事を引用しました。失うのは帰属つきの露出で、残るのは帰属のない要約です。

ペイウォールはAIシステムに記事を読ませないようにできますか?

サーバーサイドの場合だけです。しかもログイン済みの読者のエージェントに対しては、それでも止められません。クライアントサイドのオーバーレイはテキストをブラウザに送ってから見た目上隠すので、Tow Centerは、同じ2社のチャットインターフェースが拒否した9,000語の購読者限定記事を、エージェント型ブラウザが読めることを確認しました。あるページを本当に読ませてはいけないなら、必要なのはディレクティブやオーバーレイではなく認証です。

コンテンツライセンス契約を結べば、ブランドは正確に引用されますか?

公表されている唯一のテストの答えはノーです。Tow Centerは調査結果の1つとして「ニュース提供元とのコンテンツライセンス契約は、チャットボットの回答における正確な引用を何ら保証しなかった」を挙げており、その例は検索クローラーを許可し同社とのパートナーシップの内側にいる発行元で、その抜粋が正しく特定されたのは10回中1回でした。アクセスは正確な帰属を可能にしますが、正確な帰属を生み出しはしません。

robots.txtではなくファイアウォールでAIクローラーをブロックすべきですか?

その前に、あるベンダーの文書を読んでください。Anthropicは、自社のボットが稼働するIPアドレスをブロックすることは「正しく機能しない場合があり、オプトアウトを継続的に保証するものでもありません。そうすることで当社があなたのrobots.txtファイルを読む能力が妨げられるためです」と述べています。つまりネットワーク側のブロックは、フェッチはされるのに意思は届かないという状態を生みかねません。あなたの意思表示を載せたファイルこそ、そのルールがベンダーに読ませなくしたものだからです。

Bavior 編集部

Reddit マーケティングと AI 検索可視性に関する Bavior のコンテンツを調査・管理しているチームです。記事中のすべての数値には出典と確認日を明記しており、アフィリエイトリンクは一切使用していません。

数値に誤りを見つけたらお知らせください。再確認します: support@bavior.com

ブロックはスイッチではなく取引です。
何と引き換えにするのかを知ってください。

無料トライアルを開始