首页/学习 GEO/第 3 阶段
AI 搜索如何工作 · 第 3 阶段

AI 搜索的检索阶段到底发生了什么?

检索是页面还没被评判质量就已经离场的地方,也是整个领域证据最强的地方。下游的一切都被它封顶。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

检索,是每一条生成出来的搜索查询打到索引或实时抓取器上、并带回候选文档的那个阶段。它是一道闸门而不是一个排序因子:一个没被收录、抓不到、或与引擎发出的任何查询都不相关的页面,在后面每个阶段都是零分,写得多好都一样。2026 年一篇预印本发现,AI 答案中被引用的 URL 里有 27.1% 连抓都抓不下来,因为不可访问、已删除,或不是文本。7

关键要点
  • 可检索性给下游的一切封顶:一个进不了候选集的页面,在选择和合成阶段的概率都是零,文笔再好也一样。
  • 页面会在六个位置掉出检索:索引、robots.txt 令牌、渲染、失效的 URL、挡在页面前面的一道门,以及与实际发出的子查询之间的相关性。
  • 训练爬虫与搜索爬虫在 Google、OpenAI、Anthropic 和 Apple 的文档里都是两个独立令牌。屏蔽训练令牌通常没有影响,但 Google-Extended 是个例外,它同时控制 Gemini Apps 的接地;一条通配符全站禁止会把它们一次性全部端掉。
  • 把正文放进首屏 HTML 响应里:关于传统 AI 爬虫是否执行 JavaScript 的唯一一份公开测量结论是不执行,而且无人复现过。
定义

检索阶段发生了什么?

检索接收扇出产生的每一条查询,并为它返回一个候选文档集:要么来自预先构建的索引,要么来自提问当下的实时抓取。这个机制没什么玄妙的:它就是搜索,带着这个词所有寻常的后果。Google 对自己的 AI 界面就是这么说的:“我们在 Google 搜索上的生成式 AI 功能,根植于我们核心的搜索排序与质量系统”10;而要有资格成为支持链接,页面“必须已被收录,并且有资格带摘要出现在 Google 搜索里,满足搜索的技术要求”。1

两种检索模式并存,而它们的失效方式不同。基于索引的检索意味着那次关键的抓取发生在更早的时候,可能是几周前,由某个爬虫完成,而引擎手上那个版本的你的页面,就是那次爬虫看到的样子。实时检索意味着有个抓取器会在有人提问的当下拉取该 URL,这让时效性变得即时,也让响应慢、机器人挑战或一个 403 变得致命,而这些对索引来说从来都不致命。本课程涵盖的多数系统两种都跑,用的是不同的 user-agent 令牌。上一个阶段决定有多少条独立查询会到达这里;总览见AI 搜索如何工作这一阶段

失效方式

页面在哪些地方悄无声息地出局?

页面会在六个不同的位置掉出检索:索引、robots.txt 令牌、渲染、URL 本身、挡在它前面的一道门,以及与引擎实际发出的那些子查询之间的相关性。

这六种情形每一种在你的分析后台里都是看不见的,因为一个从未被检索的页面,不会产生任何“缺失的展现”。

01

不在索引里

Google 明示的要求是页面已被收录且可带摘要展示。一个 noindex、一条 max-snippet 指令,或一个指向别处的 canonical,都会在其余一切被评估之前把页面移出考虑范围。

02

屏蔽错了机器人

每家主要厂商都在文档里把“训练”和“搜索”分成两个令牌。屏蔽搜索令牌会把你从该引擎的答案里移除。屏蔽训练令牌通常不会,但有一个已被文档记录的例外:Google-Extended 现在同时控制 Gemini Apps 与 Vertex AI 上的接地,禁止它会让你从那个面上消失,而 Google 搜索与 AI Overviews 不受影响。一条通配符全站禁止则两个一起端掉。

03

正文要跑完 JavaScript 才存在

关于传统 AI 爬虫唯一一份公开测量发现,它们抓取 JavaScript 文件但不执行。Google、Bing 和 Applebot 会渲染;另外几家看来不会,所以这个风险是不均匀的,不是普适的。

04

URL 已失效或已迁移

在某基础设施服务商 2024 年 12 月的日志研究里,GPTBot 有 34.82% 的抓取打在 404 上、14.36% 打在跳转上,ClaudeBot 有 34.16% 打在 404 上;Googlebot 对应的是 8.22% 与 1.49%。6

05

前面挡着一道闸

登录墙、同意弹层、机器人对抗挑战或过狠的限流,都会终结这次抓取。只存在于图片、视频或抓取器不解析的 PDF 里的内容,同理。

06

对被问到的一切都不相关

最安静的一种。一个页面可以被完美收录、写得完美,却与扇出实际发出的任何查询都不匹配;这种情况下它不是在检索中被淘汰的,它压根就没成为候选。

这一批页面到底有多大规模,可以从另一头量出来。2026 年一篇预印本(经那篇批判性综述转述)发现,AI 答案中已经被引用过的 URL 里有 27.1% 抓不下来,因为它们不可访问、已被删除或不是文本。7 请把分母读清楚:它测的是“第三方研究者能不能抓到这个被引用的 URL”,而不是“引用它的那个引擎能不能抓到”。即便如此,这仍是“好到已经被引用”的那批页面的失败率;那些压根没走到这一步的页面,失败率必然更高,而没人测过。

天花板

为什么可检索性是天花板而不是排序因子?

因为各阶段是相乘的:一个不在候选集里的页面,在选择和合成阶段的概率都是零,而任何下游质量乘上零还是零。这也是为什么这个领域最强的实验结论讲的是“位置与在场”,而不是文笔。NeurIPS 2025 的一项基准测试在六个领域、逾 1.9k 条查询、16k 份文档上测试了十种对话式 SEO 方法,发现在零售领域里,把某个来源移到上下文第一位,平均把它的引用排名提升 2.77 位,而所测最佳内容方法只有 0.36 位;54 个受测案例中只有 3 个显著为正。8

2026 年那篇批判性综述对同一条边界给出了明确评级:“查询与文档的相关性、以及在上下文中的位置,是主要决定因素”被评为置信度,而“一项白帽干预能在多个引擎上持久改善自然可发现性”被评为9 把它读成一份“力气该往哪儿花”的排序,结论毫不含糊:先修那道闸,再去打磨闸后面的东西。

robots.txt

你到底需要放行哪个爬虫?

每家主要厂商都在文档里区分了“采集训练数据的机器人”和“构建搜索索引的机器人”。把两者搞混,是最常见的自伤式检索失败。

厂商训练 / 语料令牌搜索索引令牌屏蔽前者会让你从答案里消失吗?
GoogleGoogle-ExtendedGooglebot不会。AI Overviews 取自搜索索引1
OpenAIGPTBotOAI-SearchBot不会。文档描述了放行其一、禁止其二的做法2
AnthropicClaudeBotClaude-SearchBot不会。文档中是两个独立令牌3
AppleApplebot-ExtendedApplebot不会。禁止前者仍可被收入搜索结果4
Perplexity文档中没有PerplexityBot其文档写明用户触发的抓取器通常忽略 robots.txt5

把这四组拆分分别检查一遍,并且用一次真实抓取去验证,而不是靠假设,因为两种最常见的错误方向恰好相反。为了“不进 AI 答案”而禁止训练令牌,什么也做不到;而多年前为别的理由写下的一条通配符全站禁止,会悄悄地把每一个 AI 搜索机器人一次性端掉。也请注意什么帮不上忙:Google 的文档写道,“你不需要为了出现在 Google 搜索(包括其生成式 AI 能力)里而创建新的机器可读文件、AI 文本文件、标记或 Markdown,因为 Google 搜索本身并不使用它们。”10

渲染

引擎会渲染你的 JavaScript 吗?

取决于引擎,而诚实的结论比通常被转述的那句窄得多。Google 会渲染:它的文档写道“只要 JavaScript 未被屏蔽,Google 就能处理其中的内容”,而它的 AI 界面跑在同一个渲染过的索引上。10 Apple 会渲染:“Applebot 可能会在浏览器里渲染你网站的内容。如果 javascript、CSS 和其他资源通过 robots.txt 被屏蔽,它可能无法正确渲染内容。”4 智能体浏览器会渲染,因为它们本来就是浏览器。

至于其余那些,公开的测量只有一份。2024 年 12 月,一家基础设施服务商分析了自己的日志数据,得出结论:主要的 AI 爬虫都不渲染 JavaScript。6 此后没有发表过任何复现或相反的测量,那套“执行检测”的方法另有一篇文章说明且属于单向测试,也没有任何 AI 厂商在文档里表过态。所以站得住脚的说法是“唯一一份公开测量,来自 2024 年 12 月,没有发现执行”,而不是“2026 年 AI 爬虫无法渲染 JavaScript”。

无论如何,这个修法便宜到根本不需要把争论解决掉。只要正文出现在首屏 HTML 响应里,这个问题对任何引擎都不会发生。

排名

排名还决定着什么会被检索出来吗?

排名依然是“是否被引用”的最强单一预测因子,而它已经不再充分。发表于 Findings of ACL 2026的一项对 Google AI Overviews 的 4,706 条查询审计(数据采集于 2025 年 9 月)发现,AI Overviews 查阅过的域名中有 53% 不出现在自然结果前十,27% 连前一百都没有。11 一项 55,393 条查询、采集于 2026 年 3 月 13 日至 4 月 21 日的预印本,样本约为前者的十二倍、时间晚六个月,发现 AI Overview 引述的域名中有 29.8% 不出现在对应的首页上。13 请把它当作一个区间来引用:大约 30% 到 53%,并写明两个采集时间窗,而不是从任一项研究里取一个点值;也请把动词分清楚,Kirsten 测的是系统“查阅过”的域名,这和它“引用”的域名并不是同一回事。

SIGIR 2026 上一项 11,500 条查询的研究测得 Google 自然结果、AI Overviews 与 Gemini 之间 URL 层面的 Jaccard 相似度为 0.11–0.18。12 机制是扇出:检索是按子查询跑的,所以在可见问题上毫无排名的页面,可以在它的某个部分上排得很准。

请对任何单一的重合度百分比保持怀疑,包括上面这些,因为这个数字完全取决于一个很少被写明的分母。“有多少比例的 AI 答案里至少包含一个前十 URL”和“有多少比例的单条引用来自前十”,是两个不同的问题;2025 到 2026 年间发表的数字,从约六分之一到四分之三以上都有,取决于问的是哪个、什么时候问的、样本是什么。一个没有分母和日期的数字,不是测量。站得住脚的综合判断是方向性的:前十排名赢得高频引用,而长尾中有很大且在增长的一部分来自根本不在首页的页面。

本文的诚实边界

这里被引用最多的两个数字恰恰是最薄弱的环节。27.1% 的“抓不下来”来自一篇预印本,不是同行评议成果,而且它测的是已经被引用的 URL,不是一般网页。JavaScript 的结论依赖 2024 年 12 月的一份日志研究,其执行检测方法另有说明但属于单向测试,此后二十个月无人复现,也没有任何厂商文档做过表态,而这些产品在这段时间里变化很大。这两条都不应被当成定论。本文里扎实的部分是第一方的 robots.txt 令牌拆分和 Google 自己的准入声明,因为它们出自运营这些系统的公司。

产品在哪里派得上用场,在哪里派不上

整套检索体检都是免费的,大约一小时:用一个普通的命令行请求抓取每个重要 URL,确认答案正文在不跑 JavaScript 的 HTML 里就有;把你的 robots.txt 对照上面四组令牌拆分逐一核对;确认页面已被收录且可带摘要展示;再把自己的站爬一遍找 404 和跳转链,AI 爬虫在跟随这些方面比 Googlebot 差得多。这些都不需要任何工具,也没有工具能替你去修。Bavior 干的是再往后一个阶段的活:它按计划把一组固定的 prompt 打到五个引擎上,并记录每条答案引用了哪些来源,从而告诉你一次检索层面的修复有没有改变“谁出现了”;当被引用的来源是一条活跃的讨论帖时,它会用你掌控的账号起草回复,在任何内容发出之前由你审批。它不爬你的站点,不改你的 robots.txt,也无法让一个被屏蔽的页面变得可检索。免费 AI 可见性检测免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 29 日)。

出处,全部核查于 2026 年 8 月 29 日
  1. Google Search Central,《AI features and your website》,更新于 2025 年 12 月 10 日(准入条件、Google-Extended、摘要控制;第一方文档):developers.google.com/search/docs/appearance/ai-features
  2. OpenAI,爬虫与机器人文档(GPTBot、OAI-SearchBot、ChatGPT-User;第一方):developers.openai.com/api/docs/bots
  3. Anthropic,《Does Anthropic crawl data from the web?》(ClaudeBot、Claude-SearchBot、Claude-User;第一方):support.claude.com/en/articles/8896518
  4. Apple,《About Applebot》(Applebot、Applebot-Extended、浏览器渲染;第一方):support.apple.com/en-us/119829
  5. Perplexity,机器人文档(PerplexityBot、Perplexity-User;第一方):docs.perplexity.ai/guides/bots
  6. Zecchini、Moore、Ubl、Siddle,《The rise of the AI crawler》,Vercel,2024 年 12 月 17 日(基础设施第一方日志数据):vercel.com/blog/the-rise-of-the-ai-crawler
  7. Allaham 与 Diakopoulos,2026;AI 答案中被引用的 URL 有 27.1% 无法抓取(预印本,见出处 9 的综述转述)
  8. Puerto、Gubri、Green、Oh、Yun,《C-SEO Bench: Does Conversational SEO Work?》,NeurIPS 2025 数据集与基准赛道,arXiv:2506.11097:arxiv.org/abs/2506.11097
  9. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(综述预印本):arxiv.org/abs/2607.14035
  10. Google Search Central,《Google’s Guide to Optimizing for Generative AI Features on Google Search》,更新于 2026 年 7 月 10 日(“根植于核心搜索排序与质量系统”一句、JavaScript 处理、无需 AI 文本文件;第一方文档):developers.google.com/search/docs/fundamentals/ai-optimization-guide
  11. Kirsten 等,Findings of ACL 2026;对 Google AI Overviews 的 4,706 条查询审计,数据采集于 2025 年 9 月,覆盖美国与德国;原文为“on average 53% (27%) of domains that AIO consults are not contained in top-10 (top-100) Organic search results”:aclanthology.org/2026.findings-acl.526
  12. Grossman 等,SIGIR 2026;11,500 条查询;Google 自然结果、AI Overviews 与 Gemini 之间 URL 层面的 Jaccard 为 0.11–0.18:arxiv.org/abs/2604.27790
  13. Xu、Iqbal 与 Montgomery,2026;55,393 条趋势查询,采集于 2026 年 3 月 13 日至 4 月 21 日;原文为“29.8% of AIO reference domains do not appear anywhere on the corresponding first page”(预印本):arxiv.org/abs/2605.14021
常见问题

你想知道的,都在这里。

如果我屏蔽 GPTBot,会从 ChatGPT 的答案里消失吗?

不会。GPTBot 和 OAI-SearchBot 是分别记录在文档里的两个令牌,而决定你是否出现在“带搜索的回答”里的是搜索索引爬虫。OpenAI 自己的机器人文档就描述了“允许 OAI-SearchBot 以出现在搜索结果中,同时禁止 GPTBot”的做法。同样的拆分在 Google(Google-Extended 对 Googlebot)、Anthropic(ClaudeBot 对 Claude-SearchBot)和 Apple(Applebot-Extended 对 Applebot)都存在。真正会把你从所有 AI 答案里一次性抹掉的,是通配符全站禁止的规则,而它通常是从一份旧 robots.txt 里继承来的,不是有意选的。

我的站点必须服务端渲染才能出现在 AI 答案里吗?

取决于引擎,而把正文放进首屏 HTML 就能让这个问题对所有引擎都消失。Google 表示它“只要 JavaScript 未被屏蔽就能处理其中的内容”,Apple 也在文档里写明 Applebot 会在浏览器里渲染;智能体浏览器会渲染,因为它们本来就是浏览器。至于传统的 AI 爬虫,唯一一份公开测量,即某基础设施服务商 2024 年 12 月的日志研究,发现它们抓取 JavaScript 文件但不执行;文中的 5.69 亿次 GPTBot 是月度请求量,不是渲染测试的样本量,后者原文从未给出。那项研究至今没有被复现也没有被推翻,所以请把它当作现有最好的证据,而不是已成定论的事实。

要被 AI 搜索引用,我还需要在 Google 上有排名吗?

排名依然是“是否被引用”的最强单一预测因子,但它本身已经不够。发表于 Findings of ACL 2026的一项对 Google AI Overviews 的 4,706 条查询审计发现,AI Overviews 查阅过的域名中,平均有 53% 不出现在该查询的自然结果前十,27% 连前一百都没有。机制是查询扇出:检索是按子查询跑的,所以一个页面可以因为问题的某一部分被检索到,却在整个问题上毫无排名。请把前十排名理解为赢得高频引用的东西,把子问题覆盖理解为赢得长尾的东西。

为什么一个已被收录、写得也好的页面,依然从来没被引用过?

最常见的原因是它没有匹配上引擎实际发出的任何一条查询。检索是按扇出子查询跑的,不是按原始问题跑的,所以一个页面可以既被收录、又快、又写得好、又完全切题,却对被搜索的东西一个都不构成候选。另一个常见原因是抓取失败而不是质量判断:2026 年一篇预印本发现,AI 答案已经引用过的 URL 中有 27.1% 根本抓不下来,因为不可访问、已删除或不是文本。这两种失败在你的分析后台都不产生任何信号,所以它们会一直存在。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

可检索性就是你的天花板。
先弄清它到底在哪一层。

免费试用