ホーム/GEO を学ぶ/エンジンが引用するもの
AI引用のためのコンテンツ · 単位

AIエンジンが実際に引用するのは、ページかパッセージか?

AI引用のためのコンテンツで、これ以降のすべてはこの答えに左右されます。エンジンが持っていくのが文書ではなくテキストの一節なら、あなたが書いている対象はテキストの一節です。

このページの内容
この記事をシェア
X でシェア LinkedIn でシェア
短い答え

パッセージです。エンジンはあなたのページからテキストの一節を抜き出し、他サイトから抜き出した一節の隣に並べます。つまり回答の座を争っている対象はその一節であって、たまたまそれを含んでいる文書ではありません。この関係を扱う学術研究が文単位で測定されているのは、まさにそのためです。生成検索エンジン4つを対象にした2023年の評価では、生成された文のうち引用によって完全に裏づけられていたのは、平均でわずか51.5%でした。2

重要ポイント
  • アドレス可能な単位は約100語のパッセージで、それ自体の中身で評価されます。2,500語の記事は、その競争における約20の独立したエントリーであり、そのうち2つか3つがすべての仕事をします。
  • 引用可能性は一節の性質であって、ページの性質ではありません。主語、限定条件、数字、日付はすべてその一節の内側に置く必要があります。エンジンが読む時点では、周囲のものはすべて消えているからです。
  • 情報源が回答をどれだけ深く形づくったかについて公開されている中で最も詳細な代理指標は、段落カバー率とn-gramの重なりから組み立てられています。つまり測っているのはページではなくパッセージです。1
  • 同じデータセットでは、直接的な事実の裏づけとして使われた引用の平均影響度は0.1241、背景としてのみ使われたものは0.0775で、観測数はそれぞれ5,411件と5,100件でした。1
  • Googleは「chunking」を施策として無視してよいと言っています。6 どちらも同時に成り立ちます。読者も抽出器も自己完結した単位を必要とするからそう書く、そして誰も求めていない機械向けフォーマットは出さない、ということです。
単位

エンジンが引用しているのは、あなたのページか、そこから抜き出したパッセージか?

エンジンはパッセージを引用し、そこにあなたのURLを付けます。レンダリングされた回答では両者が1つのものに見えるため、この区別は失われがちですが、両者は切り離せますし、別々に失敗します。リンクは住所であり、パッセージは中身です。そのパッセージが単独で正しく読めるかどうかは、あなたのドメインも権威性も語数も画面に登場する前に決まっています。

この単位を最も明確に記述しているのは、2026年7月に公開された業界の集計です。1年分のAI Mode引用15,699,298件が、270万ページにまたがる460万件のユニークなハイライトパッセージへと解決されました。そのデータセットでは、引用の47.7%が単純なリンクではなくスクロール位置指定のハイライトであり、ハイライトされたパッセージの中央値は117語、80%が答えを最初の一文に置き、約85%が完全に自己完結していました。繰り返し引用されたパッセージは48%が明示的な問いかけで始まっており、一度きりのパッセージでは22%でした。

これらの数字には2つの但し書きが伴い、どちらも議論を支える柱です。この調査はベースレートを報告していないため、「引用されたパッセージの80%が答えを先に置いている」というのは、もっともらしい仕組みを裏づけはしても証明はしていません。ウェブ上のすべての段落についての割合を公表した人は誰もいないからです。そしてこれはベンダー研究なので、本カリキュラムはリンクを張らず、見つけられる程度に正確に記述するにとどめ、論拠は次のセクションの研究に置きます。

証拠

パッセージが単位だという証拠は何か?

独立した研究者たちが計測手段をどう作らざるをえなかったかを見てください。602件の統制されたプロンプト、21,143件の検索レイヤー引用、18,151件の取得ページを扱った2026年のプレプリントは、引用されたページが実際にどれだけ回答を形づくったかを測る尺度を必要としました。そこで組み立てられたスコアは、繰り返しの参照に0.20、出現位置の早さに0.15、段落カバー率に0.20、TF-IDFコサイン類似度に0.25、n-gramの重なりに0.20の重みを与えています。1 この5つの構成要素のうち3つは、回答の一部分と情報源の一部分を突き合わせるものです。この計測手段はページ粒度では作れません。ページ粒度には比べるものが何もないからです。

同じ論文は、この仕組みを正確に引用する価値のある仮説として述べています。ページは「再利用可能で意味的に整合した情報単位へと分解できるとき、生成エンジンにとって価値を持つようになる」のであり、定義、統計、比較、手順の連なりといった証拠のジャンルは「再利用可能な支持単位を作り出すが、Q&A形式は表層のラッパーにすぎない」と述べられています。1 著者たちはこの研究を記述的なものと呼び、確証的な分析は後回しにしています。したがってこの枠組みは、発見ではなく、よく特定された仮説として扱ってください。

独立した正確性の文献も、同じ粒度で測ることによって同じ方向を指しています。2023年の検証可能性評価は文を引用と突き合わせて採点し、文の51.5%が完全に裏づけられ、引用の74.5%が対応する文を裏づけていることを見つけました。2 2026年のGoogle AI Overviewsの監査は回答を98,020件のアトミックなクレームに分解し、そのうち11.0%が隣に引用されたページによって裏づけられていないことを見つけました。3 こうした失敗がブランドにとって重要かどうかは別の問いであり、統合と帰属がそれに答えます。ここで確立されるのはもっと狭く、もっと有用なことです。情報源から回答へのつながりを真面目に研究しようとした試みは、いずれもページより下の階層で作業せざるをえませんでした。

性質

パッセージがページから抜き出されても生き残るのは何によってか?

見知らぬ読者がページを消した状態でそれを読んでも何も失われないとき、そのパッセージは抜き出しに耐えます。その働きの大半を担うのは5つの性質で、5つとも一節の周りではなく内側に何があるかの話です。

01

主語を一節の内側で名指しする

「それ」「この製品」「このアプローチ」は、抽出器が持っていかない見出しを指しています。ページ上では少しくどく読めても、最初の一文でその対象をもう一度名指ししてください。

02

限定条件は主張と一緒に移動する

2段落前に書かれた制限は、そのパッセージの一部ではありません。「10シート以上の年間プランで無料」は、無料という語と同じ一節の中になければなりません。さもないとその一節は、引用できてしかも誤っている、ということになります。

03

すべての数字は分母と日付を連れて行く

サンプルも収集期間もない百分率は、下流の誰にも検証できません。2026年の批判的サーベイは、基準は数字を足すことではなく、関連性があり、検証可能で、日付が入り、出典が正しく示された証拠を提供することだと明言しています。5

04

前も後ろも指さない

隣を参照する書き出しは、隣が消えているために構造的に引用できません。禁止する書き出しの社内リストが存在する理由はこれだけであり、そこで落ちたパッセージは減点されるのではなく、見えなくなります。

05

1段落は1つの主張だけを担う

3つの主張を抱えた段落は、あなたが最も気にしていない1つのために選ばれ、残りの2つを付けたまま引用されることがあります。分割すれば、それぞれの主張が自分のチャンスと自分の失敗の仕方を持ちます。

これらはどれもランキング要因ではない

これらの性質が決めるのは、リトリーバルされて選択されたあとに、その一節が使えるかどうかです。そこまで到達させることには何の働きもしません。それはもっと早い段階で決着しており、クローラーログの読み方がこのステージより前に置かれているのはそのためです。

検証

公開する前にパッセージをどう検証するか?

その段落を空のドキュメントに貼り付けて、前後なしで読んでみてください。3つの問いで決まります。読者はどこにもスクロールせずに、その段落が何についてのものか言えますか。意味を変えうる限定条件は、目の前のテキストにすべて入っていますか。その段落は6か月後も真実ですか、それとも今は付いていない日付が必要ですか。3つのどれかで落ちる段落は、文章が下手なのではありません。その場にあるときだけ成立する書き方であり、これは別種の欠陥で、しかも目に見えません。そもそも資格のなかったパッセージについては、アナリティクスが何も報告しないからです。

価格ページと連携ページにこれを通したB2Bのドキュメントチームは、たいてい現れる型を見つけました。限定条件が各ページ冒頭の共通段落へと流れ出しており、個々には正確な12のセクションが、それぞれ引用可能でそれぞれ不完全だったのです。1つの節を各セクションに戻す作業は事実を何も変えず、ページあたり約40語を足しました。この種の修正は安上がりです。そしてチームは、その後の引用の変化をこの修正に帰属させることはできませんでした。対照群のない単一サイトでは、1つの修正と同じ期間に動いた他のすべてを切り分けられないからです。

名指しする価値のある失敗は、逆のほうです。同じ証拠を読んだあるチームは、長いガイドを疑問形の見出しを持つ30個の断片に刻み、そのガイドを引用に値するものにしていたつなぎの論理を失いました。残ったのは、他の20か所で手に入る定義を言い直しただけの30の一節でした。パッセージの証拠の大半を支えている論文は、この結果を先取りしています。その表の中で、Q&A形式は平均影響度が低いほうに関連づけられた唯一のジャンルであり、0.0947対0.1005でした。著者たちはこれを、何の仕事もしていない表層のラッパーと読んでいます。1

使われ方

どのパッセージが背景ではなく事実として使われるか?

同じデータセットは、各引用が回答の中でどう使われたかにラベルを付けています。ラベル付けされた1万9千件の引用において、直接的な事実の裏づけは背景としてのみの利用をおよそ3分の1上回っています。1

パッセージの使われ方引用数平均影響度直接的な裏づけとの差
直接的な事実の裏づけ5,4110.1241基準点
ソース横断で統合3,9670.0964−22%
言い換え5,3050.0955−23%
背景のみ5,1000.0775−38%

最後の列の百分率は、公表された平均値をもとに私たちが計算したもので、残す価値があるのは順序のほうです。検証できる事実を差し出すパッセージは事実として使われ、雰囲気を差し出すパッセージは雰囲気として使われます。そしてページが述べるのではなく描写するとき、ブランドが行き着くのはその雰囲気です。具体的な数字を日付と分母つきで書くのは、ここでは書式のテクニックではありません。それが最上段と最下段の違いそのものです。

同じ記録の2つ目の切り口は、パッセージがどう使われたかではなく何のためのものかを採点します。その表は何が引用されるかが、情報源タイプの構成と合わせて扱っています。2つの切り口は一致しますが、これは弱い証拠であって独立した証拠ではありません。3つのプラットフォーム上の1つの収集期間から来ているからです。

帰結

これは、あなたのページの書き方の何を変えるのか?

ページは最適化する対象ではなくなり、組み立てる入れ物になります。2,500語の記事は選択段階でおよそ20の独立したエントリーであり、その大半は何に対しても資格を得ることはありません。アウトラインの段階で役に立つ問いは、実際に引用してほしい一節はどの4つか5つか、そしてそれぞれが誰かが実際にその言葉で尋ねる問いに答えているか、です。この捉え直しは、文よりもアウトラインを大きく変えます。

これが許すことは、見かけより少ないのです。選択に勝つために意図的にテキストを整形し直すことは、繰り返しヌル結果になる介入です。10種類の会話型SEO手法を対象としたNeurIPS 2025のベンチマークは、54ケースのうち統計的に有意なランキング改善を示したのは3つだけだったと報告しています。4 疑問形の見出しには独立した2本の裏づけがあります。55,393件のクエリを対象とした研究は、Google AI Overviewの発動率を疑問形のクエリで64.7%、疑問形でないクエリで9.5%と測定しており3、パッセージの集計は疑問で始まる一節がおよそ2倍の頻度で再利用されることを見つけました。本記事の残りはすべて、論拠を伴う仮説であり、証拠のあるコンテンツレバーがそれらを1つずつ格付けします。

この記事の正直な限界

Googleは、2026年7月10日に更新された自社のガイドで、上のすべてを雑に読んだ解釈と食い違うことを述べています。「Google検索については、コンテンツの『chunking』、不要なAIテキストファイル(llms.txtなど)の作成、不誠実な言及の追求といった施策は無視してかまいません。」6 これは機械可読フォーマットとしてのchunkingを退けているのであって、パッセージが単位ではないと言っているわけではありません。同じガイドはクエリのファンアウトを説明し、ページがインデックス登録されスニペット掲載資格を持つことを求めています。7 擁護できる立場はこうです。自己完結したセクションが読者にも抽出器にも役立つのは同じ理由からであり、それを意図的に整形することが引用を確実に動かすと示した公表実験は存在しません。上のパッセージ統計はベンダーが公表したものです。影響度の数字は、著者自身が記述統計と呼ぶ1本のプレプリントから来ています。いずれも因果ではありません。

製品が役に立つ場面と、立たない場面

この記事のどれにもツールは要りません。パッセージのテストに必要なのは、1つの段落と空のドキュメントと3つの問いだけで、書き直しはどちらにしてもあなたの仕事です。あなたのページのどの4つの一節が引用される価値を持つかを、ソフトウェアが決めることはできません。Bavior が担当するのは同じループの測定側です。固定のプロンプトセットを5つのエンジンに定期実行し、各回答がどのソースを引用したかを記録するので、書き直しの前後比較が片側だけでなく両端に数字を持つようになります。あなたの下書きを読むことも、パッセージを採点することも、ページを編集することもしませんし、ある一節がエンジンに引用された理由だったかどうかを教えることもできません。無料 AI 可視性チェッカー無料 GEO 診断は有料プランなしで使えます。有料のトラッキングは月払いで月額 $99 から、年払いなら月額 $79.17 です(2026年8月30日時点)。

出典、すべて2026年8月30日に確認
  1. Zhang、He、Yao「From Citation Selection to Citation Absorption」arXiv:2604.25707(プレプリント。著者は記述統計と呼んでいます)。統制されたプロンプト602件、検索レイヤー引用21,143件、取得ページ18,151件。影響度スコアは§5.2、使われ方は§8.3、証拠コンテナ仮説は§9:arxiv.org/abs/2604.25707
  2. Liu、Zhang、Liang「Evaluating Verifiability in Generative Search Engines」arXiv:2304.09848。「生成された文のうち引用によって完全に裏づけられているのはわずか51.5%であり、対応する文を裏づけている引用は74.5%にとどまる」:arxiv.org/abs/2304.09848
  3. Xu、Iqbal、Montgomery、2026(プレプリント)。2026年3月13日から4月21日に収集されたトレンドクエリ55,393件。98,020件のアトミックなクレームのうち11.0%が裏づけなし。AI Overviewの発動率は疑問形クエリで64.7%、それ以外で9.5%:arxiv.org/abs/2605.14021
  4. Puerto、Gubri、Green、Oh、Yun「C-SEO Bench: Does Conversational SEO Work?」NeurIPS 2025 Datasets & Benchmarks Track、arXiv:2506.11097。10手法、1.9k件超のクエリと16k件の文書。§6.2:「54ケースのうち、ランキングの改善が統計的に有意なものは3つしか見つからなかった」:arxiv.org/abs/2506.11097
  5. 「Optimizing Visibility in Generative Engines: A Critical Survey」2026年7月15日、arXiv:2607.14035(サーベイのプレプリント):arxiv.org/abs/2607.14035
  6. Google Search Central「Google’s Guide to Optimizing for Generative AI Features on Google Search」最終更新2026年7月10日(一次情報。chunkingについてのまとめ):developers.google.com/search/docs/fundamentals/ai-optimization-guide
  7. Google Search Central「AI features and your website」最終更新2025年12月10日(一次情報。クエリのファンアウトと、インデックス登録済みかつスニペット掲載資格ありという要件):developers.google.com/search/docs/appearance/ai-features
  8. 業界によるパッセージ単位の集計、2026年7月。1年分のAI Mode引用15,699,298件が、270万ページにまたがる460万件のユニークなハイライトパッセージへと解決。パッセージの中央値は117語。ベンダーが公表したものなので、リンクは張らず記述にとどめています。
よくある質問

よく聞かれることを、まとめました。

AIエンジンは引用する前に、私のページ全体を読むのですか?

パイプラインのどこかはあなたのページを持っていますが、回答まで届くのはそこから取られたテキストの一節です。情報源が回答をどれだけ形づくったかについて公開されている中で最も詳細な代理指標は、段落カバー率、TF-IDFコサイン類似度、n-gramの重なりから組み立てられており、いずれも回答の一部分と情報源の一部分を突き合わせます。どのセクションも単独で抜き出されて、なお正確であるように書いてください。評価されている対象がそれだからです。

引用されるパッセージはどのくらいの長さにすべきですか?

公開されている唯一のパッセージ単位の集計は、ハイライトされたパッセージの中央値を117語と報告していますが、これはエンジンがたまたま取っていったものの記述であって、そこに合わせて書くための目標ではありません。健全性チェックとして扱ってください。600語に達するセクションは、それぞれ独立した見出しを持つほうがよい主張をいくつも抱えている可能性が高く、30語のセクションは、自分の主語と限定条件と日付を担いきれない可能性が高いのです。

引用されるために、ページをFAQ形式に変換すべきですか?

いいえ、証拠はむしろ逆をわずかに指しています。2026年の引用吸収データセットでは、Q&Aのページ形式は平均影響度がやや低いほうに関連づけられており、0.0947対0.1005でした。著者たちはこれを、抽出可能な証拠の供給源ではなく表層のラッパーだと読んでいます。疑問形の見出しは十分に裏づけがあり、それとは別の介入です。見出しで本当の問いを立て、その答えを、通常の自己完結したセクションの最初の一文で示してください。

パッセージが単位なら、Googleはchunkingを無視してよいと言っていませんか?

言っています。そして2つの主張は同時に成り立ちます。2026年7月10日に更新されたGoogleのガイドは、無視してよい施策の中にchunkingを挙げており、それは機械可読フォーマットを退けているのであって、生成された回答に何が含まれるかを説明しているのではありません。同じガイドはクエリのファンアウトを説明し、ページがインデックス登録されスニペット掲載資格を持つことを求めています。自己完結したセクションを書くのは、読者と抽出器が同じものを必要としているからであって、エンジンがフォーマットを求めたからではありません。

Bavior 編集部

Reddit マーケティングと AI 検索可視性に関する Bavior のコンテンツを調査・管理しているチームです。記事中のすべての数値には出典と確認日を明記しており、アフィリエイトリンクは一切使用していません。

数値に誤りを見つけたらお知らせください。再確認します: support@bavior.com

エンジンが引用するのはパッセージであって、
ページではありません。パッセージを書いてください。

無料トライアルを開始