ホーム/GEO を学ぶ/最初の90日
GEOプログラム · 運用

GEOプログラムの最初の90日はどんな形であるべきか?

あえて失敗させてよいゲートを備えた進行順です。順序は、測定が実際に何を支えられるかで決まります。1か月目に買うのは計測器であって、結果ではありません。

このページの内容
この記事をシェア
X でシェア LinkedIn でシェア
結論から言うと

最初の1か月は、ほぼ計測器を組み立てることだけに使ってください。計測器そのものの揺れが、あなたが検出したい変化より大きいからです。そのうえで、各フェーズが次のフェーズに必要な入力を産み出す順序で進め、フェーズの間にはあえて失敗させてよいゲートを置きます。temperature をゼロにしても実行を繰り返すと判定の9〜28%が変わり、4つのエンジンにわたる日次の出典レベルの Jaccard は0.34〜0.42に収まります。ですから四半期は、そのノイズを特徴づけるのにかろうじて足りる長さであり、それを上回るには足りません。1

重要ポイント
  • 90日目に測定可能な改善を約束する計画は、計測器が出せないものを約束しています。四半期が届けるのは、ベースライン、きれいな技術層、日付入りの変更ログ、そして誠実な再測定1回です。
  • 第1〜4週は計測器の設置です。プロンプト、実行回数、記録した実行メタデータ、凍結したパネルのバージョン、そして誰も手を触れないホールドアウト。
  • ゲートは4つ。それぞれに失敗したときの行動が明記されています。技術面の通過、パネルの凍結、手を触れないホールドアウト、条件を揃えた再測定です。
  • コンテンツは第5週まで待ちます。公表されているコンテンツ側の効果量は小さく、いくつかは負の値だからです。それほど小さい効果は、計測器の後ろに置くしかありません。
測定

なぜ1か月目に買うのは結果ではなく計測器なのか?

理由はプロジェクト管理の慣習ではありません。あなたが何も触らないときに測定がどう動くか、それが理由です。2026年の批判的サーベイは、再現性の証拠を一か所にまとめています。4,706件のクエリ監査が査読を経ている Kirsten らは、temperature をゼロにして実行を繰り返すと判定の9〜28%が変わることを見つけました。2 Schulte らは、小規模なスイスのクエリ集合について4つのエンジンを45日間観察し、日次の出典レベルの Jaccard が0.34〜0.42であったと記録しています。1

この2つを並べて読んでください。ある日、エンジンがあなたのプロンプト集合に対して引用する出典のかなりの部分は、前日とは違います。あなたの側では何も変わっていないのにです。介入はこれを上回らなければなりません。ベースラインが1回の読み取りではなく分布である理由もそこにあります。1つのプロンプトの1回の実行が語るのは、エンジンについてはわずかで、それを実行した1分間についてはたくさんです。

使える幅を買うのにプロンプトと実行回数がどれだけ要るかはパネルの規模で、あるパネル規模が何を検出でき何を検出できないかは統計的検出力で扱っています。ここでは繰り返しません。本記事が取るのは結論だけです。報告の単位はパネルであり、個々のプロンプトは決して報告の単位になりません。

カレンダーへの帰結は、その期限を決めた人にはっきり言っておく価値があります。90日以内なら、信頼できるベースラインを確立し、修正をリリースし、パネルを1回読み直すことはできます。しかし、特定のコンテンツ変更が特定の動きを引き起こしたと証明することまではできません。ドリフトする計測器に対する1回の前後比較では、その重さを支えられないからです。それを言うなら、第12週よりも第1週のほうがはるかに良いタイミングです。

ゲート

各フェーズはどのゲートを通過しなければならないのか?

ゲートとは、あえて失敗させてよい条件のことです。失敗しても何も起きないなら、それはマイルストーンであり、マイルストーンは何も守りません。

ゲート時期通過の条件通過しなかったら
取得可能性第4週対象範囲のページが素のフェッチで回答本文を返し、インデックスされてスニペット対象であり、依存しているクローラートークンが1つも拒否されていない止める。エンジンが取得できないページは、ほかの何も測定できません
パネルの凍結第4週プロンプト一覧、エンジンごとの実行回数、記録した実行メタデータにバージョンが付き、第12週まで変わらないベースラインを取り直す。四半期の途中で育ったパネルは、分母が分子と一緒に動いています
ホールドアウト第4週10〜15個のプロンプトが「決して手を加えない」と印を付けられ、作業する全員がどれなのかを知っている進めてよい。ただし動きは、あなたの作業が引き起こしたものではなく、作業と同時に起きたものとして報告します
再測定第12週第12週の実行が、製品、モード、モデル、ロケール、アカウント、検索が有効かどうかの各点で第4週の実行と一致しているその差は未測定として報告する。未測定はゼロではありません

ゲート1は技術面の通過です。その中身は本記事の担当ではありません。技術チェックリストが、実行コストの小さい順に項目を並べています。ここで扱うのは、なぜそれが最初に来るのかです。Google のドキュメントは、サポートリンクの候補になるにはページが「インデックスに登録されており、スニペット付きで Google 検索に表示される資格がなければならない」と述べ7、その生成AI機能は「当社の中核的な検索ランキングと品質のシステムに根ざしている」と述べています。6 これを満たさないページは、弱い測定値を出すのではありません。何も出さないのです。そしてそれを含む以降のすべての比較は、不在を結果として読んでしまいます。

ゲート4は、噛みつかれるまでは細かすぎるように見えます。サーベイの再現性ガイダンスは、2回目の実行と比較できるために1回の実行が記録すべき項目を挙げています。「製品、モード、モデル、日付、ロケール、アカウント、検索の有効化」です。1 第4週と第12週の間でこのどれか1つを変えれば、あなたが報告する差にはそれが黙って含まれます。第1週に書き留めるのはコストゼロですが、第12週に復元するのは不可能です。

スケジュール

各週のブロックは何を産み出すのか?

各フェーズが次のフェーズに必要な入力を産み出すように並べています。本当の仕様は産出物のほうで、活動はそこへ至る手段にすぎません。

01

第1–2週 · 計測器

プロンプトはキーワードツールからではなく、実際の商談、問い合わせ、失注メモから書き起こし、スケジュールに沿って実行します。産出物は、エンジンごとに区間付きのベースラインと、それらのエンジンが引用したURLです。

02

第2週 · 監査

技術チェックリストはベースラインの後ではなく、並行して走らせます。読み取りだけなので、下で進んでいる測定を乱しません。産出物は修正リストで、その大半は1スプリント分です。

03

第3–4週 · 修正と凍結

技術的な修正をリリースし、それからパネルにバージョンを付けてホールドアウトを指定します。産出物は、取得可能なサイトと、あなたが起こした理由ではもう動かない計測器です。

04

第5–8週 · サイト内

意欲の最も高いページをパッセージとして書き直します。疑問形の見出し、最初の2文に答え、分母付きの数字。産出物は、リトリーバルだけでなく選択の段階でも候補になれるページです。

05

第7–12週 · サイト外

第三者側の誤った事実を訂正し、エンティティの説明を一貫させ、エンジンがすでに引用しているスレッドに回答します。産出物は、どのURLが引用されるかの変化で、誰が望むよりも遅れて現れます。

06

第12週 · 再測定

凍結したパネルを再実行し、手を加えたプロンプトをホールドアウトと並べ、結果がどちらに転んでも書き留めます。産出物は、説明できる前後比較か、誠実な「効果なし」です。

コンテンツが第5週に来るのは、ベースラインがまだない以外にもう1つ理由があります。公表されているコンテンツ側の介入の効果量は小さく、いくつかは負の値なのです。NeurIPS 2025 の10手法のベンチマークである C-SEO Bench は、その多くが「大部分が効果がないだけでなく、文書のランキングに負の影響を与えることも多い」と報告し、54件のうち統計的に有意なランキング改善を示したのは3件だけだったとしています。4 KDD 2026 の SAGEO Arena は、モデルに固定のコンテキストを渡す代わりにリトリーバルと再ランキングを復元し、本文だけの最適化が3つの主要平均を0.58、1.00、0.50から0.53、0.84、0.47へ動かすことを見つけました。それぞれ9%、16%、6%の逆方向です。5 それほど小さい効果は、計測器の後ろに置くしかありません。

約束

90日目に誠実に約束できることは何か?

成果物は4つ。どれも「上がった数字」ではありません。エンジンごとのベースラインと区間を備えた、バージョン管理されたプロンプトパネル。フェッチレベルの監査を通る技術層。次の四半期が推測ではなく帰属を行えるようにする、日付入りの全変更ログ。そしてホールドアウトを横に置いたパネルの再測定1回。このリストは懐疑的な会議室でも持ちこたえますし、四半期が誠実に買えるのはこれです。

約束できないのは、まさに求められるものです。ランキング、特定の回答に含まれること、あるいは売上。サーベイの確信度の表は、引用スコアがクリック、コンバージョン、売上を予測するという主張を非常に低いと評価しています。1 トラフィック側も弱いです。Pew は2025年3月に900人の米国成人の68,879回の Google 検索を追跡し、AI要約の中の出典がクリックされたのは「全訪問のわずか1%」だったと報告しています。8 トラフィックのプログラムとして売られた可視性のプログラムは、一度も測っていなかった指標で判定されます。

もう1つの限界は、判断ではなく算数です。あなたのパネルが解像できる変化がおよそ10ポイントで、リリースした変更の価値が3ポイントなら、第12週の再測定には何も映りません。それは計測器の性質であって、仕事についての証拠ではありません。どれくらいの動きなら意思決定が変わるのかを第1週に決め、統計的検出力と照らし合わせてください。パネルがそれほど小さいものを見られないなら、より大きなパネルを買うか、検出できると約束するのをやめてください。

失敗パターン

どの順序の誤りが四半期を台無しにするのか?

四半期を逆順にやったチームが、この失敗を具体的にしてくれます。彼らは6週間のコンテンツスプリントで始めました。コンテンツは全員がやり方を知っている部分だったからです。測定を始めたのは第7週で、第12週には擁護できない上昇線が手元にありました。エンジンが何を見ていたかを誰かが記録する前にページが変わっていたので、「前」は記憶でしかありませんでした。パネルは22個のプロンプトから60個に育っていたので、分母が分子と一緒に動きました。ホールドアウトがなかったので、すべてを押し上げたプラットフォーム側の変更は、スプリントが効いているのと見分けがつきませんでした。仕事そのものはどれも悪くありません。順序がそれを無効にしたのです。

レビューに耐える順序

  • 対象範囲のページを1つも変える前にベースラインを取る
  • 四半期あたりパネルのバージョンは1つ、レポートに明記する
  • 誰も手を触れない10〜15個のプロンプトのホールドアウト
  • 1つの期間に動かす変数は1つ。技術、サイト内、サイト外
  • エンジンごとの数字。それぞれに固有の区間を添える

結果を無効にする順序

  • 第1〜4週のコンテンツスプリント
  • 思いついた順にパネルへプロンプトを足す
  • 技術的な修正とコンテンツの編集を同じ週にリリースする
  • エンジンをまたいで平均した1つの合成スコア
  • 1回の実行を事実として読む

合成スコアの項目が並ぶのは、好みではなく測定によります。SIGIR 2026 の11,500件の代表的クエリを対象とした研究は、Google の自然検索結果、AI Overviews、Gemini の間で URL レベルの Jaccard 類似度が0.11〜0.18であることを測定しました。3 Jaccard は積集合を和集合で割ったものであり、引用されたURLの占有率ではありません。この水準では、3つの面はほぼ交わりません。それらを平均した数字は、誰も訪れられないエンジンを記述しています。

引き継ぎ

91日目には何が起きるのか?

計画が終わり、リズムが始まります。2つは別の形をしています。90日が存在するのは、その後わずかな注意で無期限に回り続けるものを作るためです。スケジュール実行されるパネル、列が変わらない月次レポート、決して空にならないサイト外のキュー。繰り返しのリズムは週次ワークフローが、レポートの形とホールドアウトとの比較は説明できるレポートが、恒常的な請求書は運用コストが扱います。本記事は引き継ぎのところで止まります。

1つだけ、その境界を越えるものがあります。ゲートは90日目に引退しません。以降のすべての比較にかかる常設の条件になります。ベースラインを取り直し、パネルを育て、あるいはホールドアウトを失った四半期は、カレンダーが何と言おうと、この計画の第1週からやり直しています。

本記事の誠実な限界

この順序の議論は、不安定性についての証拠に立っており、この順序が別の順序より優れているという証拠に立ってはいません。その実験を行った人はいませんし、どう行うかも見えにくいです。対照条件には同じサイトの2つ目のコピーが要ります。2つの不安定性の数字はどちらも狭いサンプルから来ています。45日間の小規模なスイスのクエリ集合と、4,706件のクエリ監査です。しかもどちらも独立した追試ではなく、サーベイ経由であなたに届いています。これらが確立するのは、測定がそれ自体でかなり動くということで、そこから四半期以内に測定可能な改善を約束することは排除されます。しかし、この週の区切りが最適だと確立するわけではありません。説明できるデフォルトとして扱い、自分のベースラインが別のことを言うなら動かしてください。

プロダクトが役立つところ、役立たないところ

この計画の大半はカレンダーの規律であり、それを売る人はいません。プロンプトはあなた自身の商談と問い合わせから来ますし、技術的な修正はあなたのエンジニアの仕事ですし、凍結とホールドアウトは誰かが決めて守らなければならない判断です。どれもツールが強制できるものではありません。ツールにできるのは、繰り返しの多い中間部分です。Bavior は固定したプロンプトパネルを5つのエンジンにスケジュール実行し、各回答がどの出典を引用したかを記録し、第12週を第4週と比較可能にする実行メタデータを保持します。引用された出典が進行中のディスカッションスレッドである場合は、あなたが管理するアカウントで返信の下書きを作り、投稿の前にあなたが承認します。パネルを書くことも、いつ凍結するかを決めることもしませんし、取得できないページを取得可能にすることも、90日を短くすることもできません。無料 AI 可視性チェッカー無料 GEO 診断は有料プランなしで使えます。有料プランは月払いで月額 $99 から、年払いなら月額 $79.17 です(2026年8月30日時点)。

出典、すべて2026年8月30日に確認
  1. 「A Critical Survey of Generative Engine Optimization (2023–2026)」、2026年7月15日、arXiv:2607.14035。9–28%の繰り返し判定の変化(Kirsten ら)、日次の出典レベルの Jaccard 0.34–0.42(Schulte ら、4エンジン、45日間、小規模なスイスのクエリ集合)、再現性の項目と表5(プレプリント):arxiv.org/abs/2607.14035
  2. Kirsten ら「Characterizing Web Search in The Age of Generative AI」、Findings of ACL 2026。4,706件のクエリ、米国とドイツ、2025年9月:aclanthology.org/2026.findings-acl.526
  3. Grossman ら、SIGIR 2026。11,500件の代表的クエリ。URLレベルの Jaccard 0.11–0.18:arxiv.org/abs/2604.27790
  4. Puerto、Gubri、Green、Oh、Yun「C-SEO Bench: Does Conversational SEO Work?」、NeurIPS 2025 Datasets & Benchmarks Track、arXiv:2506.11097:arxiv.org/abs/2506.11097
  5. 「SAGEO Arena」、KDD 2026、arXiv:2602.12187v2。表2、本文のみの平均とベースラインの比較:arxiv.org/abs/2602.12187
  6. Google Search Central「Google’s Guide to Optimizing for Generative AI Features on Google Search」、最終更新2026年7月10日(「根ざしている」の一文。一次情報):developers.google.com/search/docs/fundamentals/ai-optimization-guide
  7. Google Search Central「AI features and your website」、最終更新2025年12月10日(インデックス登録済みでスニペット対象。一次情報):developers.google.com/search/docs/appearance/ai-features
  8. Pew Research Center「Google users are less likely to click on links when an AI summary appears in the results」、2025年7月22日。米国成人900人、68,879回の検索、2025年3月:pewresearch.org
よくある質問

よく聞かれることを、まとめました。

GEOプログラムは90日以内に測定可能な改善を証明できますか?

まれです。それを約束する計画は計測器を過大に売っています。temperature をゼロにしても実行を繰り返すと判定の9〜28%が変わり、4つのエンジンにわたる日次の出典レベルの Jaccard は0.34〜0.42です。ですから四半期は、そのドリフトを特徴づけてパネルを1回読むのにおおよそかかる時間です。代わりに、信頼できるベースライン、きれいな技術層、誠実な再測定を約束してください。

なぜ最初の1か月にコンテンツの作業がないのですか?

ベースラインを取る前に変わったページは、以降のすべての比較を壊すからです。その場合「前」は記憶としてしか存在しません。理由はもう1つあります。公表されているコンテンツ側の効果は小さく、しばしば負の値です。C-SEO Bench では54件のうち有意なランキング改善は3件だけでした。それほど小さい効果は、計測器がすでに動いていなければ読み取れません。

なぜプロンプトパネルを第12週まで凍結しなければならないのですか?

四半期の途中で育ったパネルは、分母が分子と一緒に動いており、第12週の系列は第4週の系列と比較できなくなるからです。第4週の終わりにプロンプト一覧、エンジンごとの実行回数、記録した実行条件を凍結してバージョンを付け、新しい問いは今期ではなく次の四半期のパネルに入れてください。

90日目に何も動かなかったら何を報告しますか?

その「効果なし」を、パネルのバージョン、観測数、区間を添えて報告し、パネルがどれくらいの動きなら検出できたはずかを述べてください。10ポイントを解像する計測器から出た平坦な線は、3ポイントの変化が失敗した証拠ではありません。パネルにそれが見えなかった証拠です。この区別が、レポートと物語の違いです。

Bavior 編集部

Reddit マーケティングと AI 検索可視性に関する Bavior のコンテンツを調査・管理しているチームです。記事中のすべての数値には出典と確認日を明記しており、アフィリエイトリンクは一切使用していません。

数値に誤りを見つけたらお知らせください。再確認します: support@bavior.com

1か月目に買うのは計測器です。
修正を始める前に、それを動かし始めてください。

無料トライアルを開始