首页/学习 GEO/第 1 阶段
AI 搜索如何工作 · 第 1 阶段

查询理解阶段,也就是 AI 搜索的第一步,到底发生了什么?

第一阶段是整条管线里你的网站唯一碰不到的一环。它依然值得弄懂,因为几乎每一次不可靠的 AI 可见性测试,都是栽在这里,而不是栽在更下游。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

查询理解是 AI 引擎把一条对话消息转成机器可读意图的那个阶段:这是哪一类问题、它指向哪些实体、适用哪些约束(比如地区和时效),以及要不要发起搜索。它发生在触碰任何文档之前,输入只有用户的措辞、到目前为止的对话,以及引擎自己的先验,所以你网站上的任何东西都够不到它,而你唯一能控制的第一阶段输入,是你测量时选用的那条 prompt。2026 年一项覆盖 55,393 条 Google 趋势查询的测量研究记录到:全部查询中 13.7% 出现了 AI Overview,问句形式的查询升到 64.7%,非问句查询只有 9.5%。2

关键要点
  • 第一阶段只跑在三个输入上,而这三个你都不拥有:用户的措辞、对话历史,以及引擎训练出来的先验。这里不会去读任何页面、schema 块或某个约定路径下的文件。
  • 措辞决定了会不会出现 AI 答案。问句形式的查询触发 AI 答案的频率是非问句查询的数倍,三项采用三种不同方法的研究都指向这个方向。
  • 一个含糊的品牌名会在搜索开始之前被解析成某一个实体。如果这次解析走错了方向,第二到第五阶段会在一个从来就与你无关的问题上完美无瑕地运行。
  • 追问在被搜索之前会先对照对话历史改写,所以同一条 prompt 在全新会话里和在长线程里,是两个不同的实验。
定义

查询理解阶段发生了什么?

查询理解,就是把一条人类消息转换成管线后续能据以行动的机器意图。它吐出四样东西:一个意图类型、一组已解析的实体、一组约束条件,以及一个“要不要检索”的路由决定。关键的区分在于:你的 prompt 不是查询。“这对两个人的团队值得吗?”是一次对话轮次;第二阶段收到的是一个结构化意图,而第三阶段收到的是一组搜索字符串,它们可能和你键入的内容几乎没有共同词汇。

Google 在自己的文档里描述了紧接着的下一步:AI Overviews 和 AI Mode“可能会使用一种‘查询扇出’技术”,去“跨子话题和数据源发起多次相关搜索”来生成回答。1 而扇出所展开的那些子话题,来自“理解”的结果,不是来自那串字面文本。这就是为什么一个页面能被一个和它毫无共同词汇的问题检索到,也是为什么一个看起来完美回答了某问题的页面,却可能错过那个问题。

路由决定

是不是每个问题都会触发 AI 答案?

不是。在 Google 上,是否出现 AI Overview 就是在这个阶段决定的,而触发率高度依赖查询是怎么措辞的。2026 年一篇预印本跟踪了 40 天内 55,393 条趋势查询,测得问句形式的查询触发 AI Overview 的比率为 64.7%,非问句查询为 9.5%,相差 6.8 倍;全部查询上的比率是 13.7%,但这个数字本身已经把问句包含在内,所以“问句对非问句”才是更锋利的对比。2 SIGIR 2026 上一项 11,500 条查询、使用代表性样本(而非趋势样本)的研究发现,51.5% 的查询出现了 AI Overview。3 这两个数字并不矛盾;它们抽样的是不同的总体,而这件事本身就是读这类文献的功课。

一项覆盖 1.46 亿个搜索结果页、2026 年 1 月发布的大型厂商研究,用第三种方法给出了同样的方向:问句查询上出现 AI Overviews 的比例为 57.9%,非问句结果页为 15.5%,且触发它们的关键词中 99.9% 是信息型。6 三种独立方法,一个方向。这是整个领域最稳健的结构性发现,而且它是一个第一阶段的发现:讲的是查询的形状,不是你页面的写法。

由此得出的是一个关于测量的结论。如果你的测试 prompt 压根没触发 AI 答案,你了解到的是关于这条 prompt 的事,而不是关于你可见性的事。把触发率和引用率分开记录,否则你会不断地把一堆本来就没机会的零平均进去。

歧义

引擎怎么判断你说的是哪个实体?

引擎会为每个含糊的名字挑定一种读法,而管线其余的一切都会继承这个选择,不可申诉,通常也没有任何可见信号提示曾经做过选择。一个同时也是普通名词的产品名、一家和另一个行业里更大的公司同名的公司、一个在相邻行业里有三种含义的缩写,每一个都会迫使第一阶段做出解析;如果解析走向了另一边,第二到第五阶段会在错误的实体上完美无瑕地运行。你的页面不是被拒绝了,它从来就没参赛,因为引擎真正搜索的那个问题问的是别的东西。

证据在这里就到头了,这一点值得挑明。没有引擎公开过自己的实体解析,也没有任何公开基准测量过 AI 搜索多久会把一个品牌名解析错。接下来的内容是从“检索如何运作”推断出来的,不是一个被测量过的杠杆:在任何地方都用同一个产品名;在自己的页面上用一句平实的话写明品类,而不是让人去意会;并确保描述你的第三方页面用的是同一个名字和同一套品类词。如果语料一致地把某个名字和某个品类关联起来,解析就有更多依据。这是一个说得通的机制,不是一个已被证明的机制;任何给这个说法附上百分比的人,卖给你的是一个没人测过的数字。

上下文继承

对话历史如何改变查询?

一条追问在被搜索之前,会先对照对话历史改写,所以真正跑起来的查询并不是你键入的那一条。

下面两栏就是 2026 年那篇批判性综述的“最小研究清单”:开跑前该记录什么,以及什么会悄悄让这次测试作废。4

每次测试前先记下

  • 确切的产品与模式:聊天、搜索模式,还是 AI Mode
  • 模型版本,在界面能看到的情况下
  • 日期、时间与地区
  • 那一轮是否开启了搜索
  • 一个全新的、未登录、无存储记忆的会话
  • 逐字不变的 prompt,多次运行之间不得改动

会悄悄让这次测试作废

  • 在上一次测试的同一个对话线程里接着问下一条
  • 让账号记忆或历史把答案个性化
  • 在两次运行之间把 prompt 稍微改了改措辞
  • 每个引擎只跑一次,然后把它当作你的位次
  • 把几个引擎平均成一个可见性分数
  • 把“没有出现 AI 答案”读成“我们不可见”

在关于三个产品的问题之后问“那价格呢?”,引擎会从对话里解析出代词、主语和对比集合,然后去搜索改写后的那一版,而不是你敲下的那几个字。这对用户很贴心,对测试却是致命的:两个人在两个线程里跑同一份脚本,跑的是两个不同的实验。这也是为什么同一条 prompt 在全新会话里和在长线程里,可能给出几乎没有共同来源的答案。

随机性还会叠加上来。2026 年那篇批判性综述报告:在商用引擎上重复运行同一查询,结果的 Jaccard 重合度为 0.34–0.42;在温度可控的界面上,重复决策的变化率为 9–28%。4 2026 年一篇统计学论文对多个引擎既做了连续九天的每日采样,也做了十分钟间隔的采样,结论是引用分布服从幂律且波动很大,而且“域名之间许多表面上的差异落在测量过程的噪声基底之内”。5 先控制会话,再重复运行,最后报告一个分布。

没有着力点

为什么你拥有的东西影响不了第一阶段?

因为第一阶段只有三个输入,而这三个你都不拥有:用户的措辞、对话历史,以及引擎自己训练出来的关于语言和实体的先验。此时还没有任何文档被抓取。这个阶段里没有任何一个槽位会去读页面、schema 块、robots 指令,或某个约定路径下的文件;而在“文件”这一项上,Google 自己的文档给出了否定:“你不需要为了出现在这些功能里而创建新的机器可读文件、AI 文本文件或标记。”1

这是一个值得随身带着的诊断法。遇到一条 GEO 主张,先问它作用在哪个阶段。如果诚实的答案是第一阶段,也就是任何被表述成“让引擎在搜索之前就理解你的品牌”的说法,那么要么这条主张是把后面阶段的工作描述错了,要么它背后根本没有机制。管线在那里没有门。

应用

关于第一阶段,你实际能做什么?

像挑关键词一样认真地挑你要测量的 prompt,因为 prompt 是你手里唯一的第一阶段输入。按买家真会键入的样子写,写成完整的句子,因为问句形式的查询触发 AI 答案的比率,大约是非问句查询的四到七倍。要覆盖整个决策过程,而不只是品牌问题:这个品类是什么、有哪些选项、要花多少钱、会出什么问题。一份只由“最好的 X 工具”组成的 prompt 集,测的只是一次购买对话里很窄的一片。

然后把“是否触发”当作数据而不是噪声。分别记录:有没有出现 AI 答案、你有没有被引用、你有没有被准确描述。这是三种不同的失败,对应三种不同的修法;综述自己的建议也是“分别测量检索、引用与保真度”。4 AI 搜索如何工作这一阶段的其余部分讲的都是这一阶段之后的阶段,在那些阶段里你才真的有输入。

本文的诚实边界

第一阶段是整条管线里文档最少的一环,本文也相应是这一组文章里推断成分最重的一篇。没有引擎公开过自己的查询理解;没有任何公开基准测量过 AI 搜索多久会把一个品牌名解析到错误的实体上;实体那一节里的命名建议是一个说得通的机制,背后并没有被测量过的效应量。这里证据扎实的部分很窄:问句形式查询的触发率,以及运行间的波动数据。其余都是工作模型。任何人给你一个关于第一阶段的、很有把握的数字,都请当作是在给一件没人测过的事下断言。

产品在哪里派得上用场,在哪里派不上

这里的整套方法都是免费且手工的:写 20 条买家真会键入的 prompt,在每个引擎上开一个全新的、未登录的会话,逐字粘贴进去,记录三列:有没有出现 AI 答案、你有没有被引用、描述得对不对。分三天各跑一次,因为跑一次只是一个样本。一张表格完全够用;唯一会崩掉的是你每周坚持做下去的意愿。Bavior 自动化的正是这份重复,按计划把一组固定的 prompt 打到五个引擎上,逐次记录被引用的来源,让你看到分布而不是截图;当被引用的来源是一条活跃的讨论帖时,它会用你掌控的账号起草回复,在任何内容发出之前由你审批。它影响不了第一阶段,因为没有任何东西能:它不会改变引擎如何解析问题、如何解析你的品牌名,或如何决定要不要搜索。免费 AI 可见性检测免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 29 日)。

出处,全部核查于 2026 年 8 月 29 日
  1. Google Search Central,《AI features and your website》(查询扇出、无需特殊文件或标记;第一方文档):developers.google.com/search/docs/appearance/ai-features
  2. Xu、Iqbal 与 Montgomery,2026;40 天内 55,393 条趋势查询,采集于 2026 年 3 月 13 日至 4 月 21 日;问句形式查询的 AI Overview 触发率为 64.7%,非问句查询为 9.5%,论文写明相差 6.8 倍;全部查询上为 13.7%(预印本):arxiv.org/abs/2605.14021
  3. Grossman 等,SIGIR 2026;11,500 条查询,代表性样本中 51.5% 出现 AI Overview:arxiv.org/abs/2604.27790
  4. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(综述预印本):arxiv.org/abs/2607.14035
  5. Sielinski,《Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement》,2026 年 3 月,arXiv:2603.08924(预印本):arxiv.org/abs/2603.08924
  6. AI Overview 触发研究,2026 年 1 月:1.46 亿个搜索结果页、7,670 万条 AI Overviews;问句查询 57.9% 对非问句结果页 15.5%,触发关键词中 99.9% 为信息型。厂商发布;按本课程的出处规则,只描述、不链接。
  7. Aggarwal 等,《GEO: Generative Engine Optimization》,KDD 2024,arXiv:2311.09735(本管线模型出发点的“检索加合成”框架):arxiv.org/abs/2311.09735
常见问题

你想知道的,都在这里。

为什么 AI 引擎回答的完全是另一个问题?

因为第一阶段把你的问题解析成了一个意图,而这次解析跑到了你没打算去的地方。含糊的产品名、跨行业共用的缩写、从对话前文继承来的代词,都在“理解”这一步被定死,发生在抓取任何文档之前,而后面每个阶段都会继承这个决定,且没有任何可见信号提示曾经做过选择。于是答案是为一个错的问题正确地构建出来的。想区分是理解失败还是检索失败,最快的办法是在全新会话里把实体写得毫不含糊,再跑一遍同一条 prompt。

问句形式的 prompt 真的更容易触发 AI 答案吗?

是的,而且这是这个领域中被交叉印证得最好的结构性发现,来自三种独立方法。2026 年一篇预印本跟踪了 40 天内 55,393 条趋势查询,测得问句形式查询触发 Google AI Overview 的比率为 64.7%,非问句查询为 9.5%,相差 6.8 倍。SIGIR 2026 上一项 11,500 条查询、采用代表性样本的研究发现 51.5% 的查询出现了 AI Overviews。2026 年 1 月一项覆盖 1.46 亿个搜索结果页的厂商研究报告:问句查询 57.9%,非问句结果页 15.5%。样本不同,方向一致。

我能让 AI 引擎在搜索之前就“理解”我的品牌吗?

没有任何有文档依据的机制,因为第一阶段不接收来自你站点的输入。理解只跑在用户的措辞、对话历史和引擎自己训练出来的先验上,发生在抓取任何文档之前,也没有任何一个位置会去读一个页面、一段 schema 或某个约定路径下的文件;Google 的文档也直接写明,出现在它的 AI 功能里不需要新的机器可读文件或标记。全网一致的命名有可能帮助解析,但没人发表过它的效应量,所以任何附了百分比的这类说法,都应视为未经测量。

为什么同一条 prompt 在新对话和旧对话里给出的来源不一样?

因为追问在被搜索之前会先对照对话历史改写,所以真正跑起来的查询并不是你键入的那一条。代词、对比集合和被省略的主语,都在第一阶段从历史里补齐。再叠加引擎自身的运行间波动:2026 年那篇批判性综述报告,商用引擎上同一查询重复运行的 Jaccard 重合度为 0.34–0.42,于是两个对话线程就成了两个不同的实验。请在全新的、未登录且关闭记忆的会话里测试,并把每条 prompt 重复跑几次,再去解读结果。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

第一阶段不由你决定。
另外四个由你决定。

免费试用