首页/学习 GEO/答案为何变化
AI 搜索如何工作 · 专题

为什么同一个问题跑两次,AI 给出的答案会不一样。

一小时后在同一个引擎上重复同一条 prompt,你会拿到一组不同的来源。这不是故障,而是这套系统被实测出来的行为,它决定了什么才算是关于你自身可见性的证据。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

AI 答案在完全相同的两次运行之间会变化,是因为管线里有多个阶段是“采样”出来的而不是“算”出来的,而且它们脚下的索引还在移动。temperature 只管其中最后一个阶段,所以把它设成零并不能让系统变得可复现。在四个引擎上连续 45 天的测量中,Schulte 等人记录到同一条查询返回的来源在天与天之间的 Jaccard 为 0.34–0.42;另一项覆盖 4,706 条查询的同行评议审计发现,即便在 temperature 为零时重复运行,仍有 9–28% 的决策会变化。两项结果均转述自 2026 年的批判性综述。1

关键要点
  • 两次运行之间有四样东西在变:查询扇出、实时索引、上下文截断线附近的重排,以及生成。temperature 只碰得到最后一样。
  • Jaccard 是交集除以并集,不是“被引用 URL 里保留下来的占比”。在实测的 0.34–0.42 上,重复跑一次就会稳定地带回第一次没出现过的来源。
  • 一张截图只是一次抽样。请按引擎分别报告比例,并在旁边写上运行次数:哪怕在同一家公司内部,各界面之间的一致性也只有 Jaccard 0.11–0.18。
机制

AI 答案引擎内部到底哪些环节是随机的?

同一条 prompt 的两次运行之间,至少有四样东西在变,而语言模型的采样 temperature 只是其中一样。沿着AI 搜索如何工作这一阶段描述的管线走:第一样是查询展开。Google 的文档写明,AI Overviews 和 AI Mode“可能会使用一种‘查询扇出’技术……来生成回答”,即跨子话题和数据源发起多次相关搜索。3 这些子查询是生成出来的,不是查表得到的,所以在任何排序发生之前,不同的子查询集合就已经产生了不同的候选池。

第二样是检索本身。每条生成的子查询打到的是一个持续重新抓取、跨机器分片、还受新鲜度和个性化逻辑影响的实时索引。第三样是选择:候选被合并、去重、重排并裁剪到上下文预算之内,而卡在截断线附近的近似并列,每次运行的解法都不同。第四样是生成:模型决定把选中的来源里的哪一个挂到哪一句话上,一个来源可以被检索到、被读取,然后不被引用。

这四样里有两样位于你能控制的一切之上游,这就是为什么把 temperature 调到零并不能让系统变成确定性的。2026 年的批判性综述把话说得很直白:即便报告了 temperature 为零,它“既固定不了索引,也固定不了检索,更固定不了外部服务的版本”。1

幅度

完全相同的两次运行,差别有多大?用数字说。

今天的来源和明天的来源之间,Jaccard 重合度约为 0.34–0.42:这是 Schulte 等人在四个引擎上连续 45 天、基于一个规模不大的瑞士查询集测得的。

Jaccard 相似度=两个集合的交集除以并集:来源集合完全相同得 1.0,毫无交集得 0。它不等于“上次的来源保留下来的占比”。

0.34–0.42

重复运行之间的重合度

商用引擎上同一条查询返回的来源在天与天之间的 Jaccard 重合度,跨四个引擎、连续 45 天测得,见于 2026 年的批判性综述。

9–28%

重复决策的变化率

在一项覆盖 4,706 条查询的同行评议审计中,temperature 为零时重复决策发生翻转的比例。生成步骤的确定性并不能换来答案的确定性。

power law

引用分布的形状

跨域名的引用次数服从幂律且波动很大。少数域名被持续引用;很长的一条尾巴被不可预测地引用。

用一个具体例子更容易体会 0.38 的 Jaccard 是什么意思。如果某引擎每条答案引用八个来源,两次运行的重合度是 0.38,那么两次合起来大约是十一个不同的来源,八个里大约有五个重复出现。跑第三次,你还会遇到没见过的来源。这几次运行之间,你的页面什么都没变;变的是样本。

2026 年 3 月那篇统计学框架还补了一个大多数人跳过的发现:高频被引集合内部的排名是不稳定的,不只是头部,而是整体,且“域名之间许多表面上的差异落在测量过程的噪声基底之内”。2 这正是大量 AI 可见性报告“自信地错着”的原因:一个只测了一次、不带区间的真实数字,无法与测量自身的抖动区分开。

噪声基底

为什么大多数品牌是在噪声里,而不是在噪声之上?

因为幂律分布把几乎所有人都放进了那条平坦的尾巴,而在尾巴里,运行间的波动大于相邻者之间的差距。如果某个域名在一批 prompt 的 6% 的回答里出现,竞品是 9%,这三个百分点的差距小于你换一个下午重跑同一批 prompt 会看到的离散程度。2026 年 3 月那篇论文的自助法区间在真实域名上就是这么显示的:这种量级的差距落在噪声基底之内。2

至于为什么,其算术没有争议,也不需要任何研究背书。对于在 n 次独立运行上测得的一个比例,若其取值接近 50%,则 95% Wilson 区间的半宽大约是「1.96 除以(n 加 3.84 后再开平方,然后乘二)」。5 次约 ±33 个百分点,10 次约 ±26,30 次约 ±17,100 次约 ±9.6。要比较两个这样的测量值,比如这个月对上个月、你对竞品,需要两个区间互不重叠,这大约还要再多付 40% 的样本量。这是二项分布的算术,不是任何论文的发现;它也解释了为什么五次抽查检测不出任何小于“巨大”的变化。

由此得到一个“在真实预算下什么可检测”的层级:「我们在有些答案里出现、有些里没有」几次运行就够;「我们从几乎不出现变成经常出现」需要几十次;「我们对竞品拉开了三个百分点的份额」,在任何小团队真会跑的样本量下都测不出来。

漂移

答案变化是不是也因为网页本身变了?

是的,而且这种漂移与运行间的随机性是两回事:它更大、更慢,因此更容易被误当成“结果”。任何一次测量底下都跑着三个时钟。索引在变,因为页面在被发布、更新、删除。引擎在变,因为模型和检索栈会被替换,通常不会公告。抓取层也在变:Cloudflare 的 2025 年度回顾报告称,全年 AI 机器人占 HTML 请求的 4.2%,其中“用户触发”的抓取增长超过十五倍,某个助手的用户触发代理峰值达到年初的十六倍。4

关于引擎漂移,最锋利的公开例证来自一项覆盖 230,000 条 prompt、超过 1 亿条引用的商业三个月研究,采样区间为 2025 年 7 月中到 10 月中:其中记录到,某个助手对一个大型讨论平台的引用率在约六周内从约 60% 的回答降到约 10%,同一窗口内某百科来源也出现了同量级的下跌。5 没有任何出版方做过什么导致了这件事。一个恰好在这六周里做前后对比测试的团队,会测出一个来自“自己内容工作”的巨大效应,而在归因上完全错了。

第四个、也更安静的变化来源是来源可用性:2026 年一篇预印本(经那篇批判性综述转述)发现,AI 答案中已被引用过的 URL 里有 27.1% 抓不下来:不可访问、已删除或非文本。6 某个来源在你两次运行之间躲进登录墙,答案就变了,而你这边什么都没动。

本文的诚实边界

0.34–0.42 和 9–28% 这两组数字是经由一篇跨引擎、跨时间段汇总多项研究的综述转述给你的,不是针对你实际在用的那些产品做的单一受控实验;其中 Jaccard 这一档来自一个规模不大的瑞士查询集。也没有任何引擎公布过自己的运行间波动数据。“正负 1 除以根号 n”的算术假设各次抽样相互独立,而同一个会话里的重复运行并不独立:会话状态和缓存会让它们相关,所以同会话运行算出来的区间偏乐观。27.1% 那个数字测的是“第三方研究者能不能抓到这个被引用的 URL”,不是“引用它的那个引擎能不能抓到”。请把本文的每个数字都当成量级参考,而不是可以填进表格的常数。

证据质量

为什么一张 AI 答案的截图不算证据?

一张截图是从某个分布里抽的一个样本,而这个分布的离散程度大过内容团队想检测的几乎任何效应。它仍然在三件窄事上有用:证明某种形态的答案是可能出现的、捕捉一处具体的事实错误以便发起更正请求、以及让相关方看清这个界面长什么样。它无法支撑任何关于频率、关于排名、关于随时间变化、或关于竞品的主张。

截图还掩盖了第二种失效方式。引擎彼此之间的差异,大过它们与自己前后的差异:SIGIR 2026 上发表的那项 11,500 条查询的研究报告,Google 自然结果、AI Overviews 与 Gemini 三者之间返回来源的平均 Jaccard 相似度低于 0.2,两两之间为 0.11 到 0.18,而这三个界面来自同一家公司。7 一个界面的截图对其他界面什么都说明不了,所以「我们查过了,我们不在里面」通常只是关于某个下午、某一个界面的陈述。用的是哪个界面、哪个模式、哪个地区,以及是否开启了搜索,都会改变答案,而这些在图片里全都看不见。

方法

要跑多少次,一个数字才开始有意义?

2026 年那篇综述给出的起点是每条 prompt 重复七到八次,一直重复到估计值周围的区间窄到足以支撑手头这个决策为止。1 跑一次只是一个样本,而它来自一个比你想看的大多数效应都更宽的分布。

下面这套流程用一张表格就能跑。

在看到任何一条答案之前,把 prompt 集合书面固定下来

20 到 50 条真实买家会打出来的 prompt,写下来并冻结。看到一条好答案之后再补一条 prompt,就是测量变成营销素材的方式。那些完全没提到你的 prompt 要留着:它们是分母。

每一次都记录条件

产品、模式、模型版本、日期、地区,以及是否开启了搜索。2026 年那篇综述把这些列为该领域任何一项研究都必须报告的最低要求,因为缺了这些字段的结果无法与任何东西比较,包括你自己上一次的运行。

把运行摊到几天里,而不是几个标签页里

一小时内跑 30 次,基本上是在对同一个索引状态重复采样。三周里跑 30 次,采的才是你真正关心的东西。条件允许的话,每次用一个全新会话,让各次抽样更接近独立。

按引擎分别报告一个带区间的比例

「在某引擎的 40 次运行里被引用了 11 次」是一句你能辩护的话。跨引擎混合成一个可见性总分则不是,因为哪怕在同一家公司内部,各界面之间的一致性也只有 Jaccard 0.11–0.18。

记录被引用的来源,而不只是“你有没有出现”

一条答案引用了哪些 URL,这个清单比正文更稳定、也更可操作,它会告诉你实际在和哪些第三方页面竞争。其中大部分不会是你的。

一次只改一样,然后等得比你觉得合理的时间更久

重新抓取和重新索引的延迟意味着,页面改动和它的效果之间隔着好几周,而这几周里引擎侧的漂移可能比你的改动更大。一周里发布的两处改动,事后无法区分。

产出是一个区间,它不如一个排名让人满意,但有用得多。衡量 AI 可见度这一阶段 会把它变成一份完整的测量计划。今天就值得养成的那个习惯更小:每当你写下一个 AI 可见性数字,就在旁边写下它来自多少次运行。没有 n 的数字不是测量。

产品在哪里派得上用场,在哪里派不上

上面这一整套,用一张表格、一个日历提醒,加上把同一批 prompt 跑一个月的耐心就能完成。Bavior 在这个具体问题上做的,是把“耐心”这项要求去掉:它按计划把一组固定的 prompt 打到五个引擎上,并记录每条答案引用了哪些来源,于是你读到的是跨多次运行的分布,而不是某个下午的一张截图。它不会降低波动,无法解释某一条答案为什么变了,也永远不会在样本显示“这是噪声”的时候告诉你三个百分点的移动是真的。免费 AI 可见性检测免费 GEO 体检不需要付费方案;付费追踪为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 29 日)。

出处,全部核查于 2026 年 8 月 29 日
  1. Martinez,《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(综述预印本)。第 6.2 节:Schulte 等人的每日 Jaccard 0.34–0.42(四个引擎、45 天、规模不大的瑞士查询集);Kirsten 等人覆盖 4,706 条查询的同行评议审计,temperature 为零时重复决策变化 9–28%:arxiv.org/abs/2607.14035
  2. Sielinski,《Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement》,2026 年 3 月,arXiv:2603.08924(预印本;三个平台,九天每日采样加十分钟间隔采样):arxiv.org/abs/2603.08924
  3. Google Search Central,《AI features and your website》(查询扇出;第一方文档,最后更新于 2025 年 12 月 10 日):developers.google.com/search/docs/appearance/ai-features
  4. Cloudflare,《Radar 2025 Year in Review》(数据区间 2025 年 1 月 1 日至 12 月 2 日;AI 机器人占 HTML 请求 4.2%,用户触发抓取增长超过 15 倍,某个代理峰值达到年初的 16 倍):blog.cloudflare.com/radar-2025-year-in-review
  5. 三个月引用时间序列研究,230,000 条 prompt、超过 1 亿条引用、三个助手,2025 年 7 月 14 日至 10 月 12 日;即上文描述的那次讨论平台引用率骤降。厂商发布;按本课程的出处规则,只描述、不链接。
  6. Allaham 与 Diakopoulos,2026 预印本(见于 arXiv:2607.14035 第 8.3 节):AI 答案中已被引用的 URL 有 27.1% 因不可访问、已删除或非文本而无法被研究者抓取
  7. Grossman 等,SIGIR 2026,11,500 条查询;摘要给出的平均 Jaccard 低于 0.2,贡献列表给出的两两 Jaccard 为 0.11–0.18,覆盖 Google 自然结果、AI Overviews 与 Gemini:arxiv.org/abs/2604.27790
常见问题

你想知道的,都在这里。

把 temperature 设成 0 能让 AI 答案可复现吗?

不能。temperature 只控制生成步骤内部的采样,而生成是至少四个会变动的阶段中的最后一个。查询扇出每次生成的子查询集合不同,检索打到的是持续变化的实时索引,重排在临界处的并列每次解法也不同。一项覆盖 4,706 条查询的同行评议审计(转述自 2026 年的批判性综述)发现:恰恰是在 temperature 可固定的界面上,temperature 为零时重复运行仍有 9–28% 的决策会变化。

要跑多少次,才能看出我的内容工作真的起了作用?

比大多数团队实际跑的次数多,而且诚实的答案取决于效应有多大。对于一个接近 50% 的比例,95% Wilson 区间的半宽大约是「1.96 除以(运行次数加 3.84 后再开平方,然后乘二)」:跑 10 次约 ±26 个百分点,30 次约 ±17,100 次约 ±9.6。要比较改动前后,还需要两个区间互不重叠,这大约又要多付 40% 的样本量。这是普通的二项分布算术,不是任何研究的结论,它意味着五次抽查只能发现那些不测也看得出来的变化。

如果每次答案都不一样,测量 AI 可见性还值得做吗?

值得,但要当成分布来测,而不是排名。「八月在这个引擎上,40 次运行里有 11 次被引用」是一句站得住脚、能支撑决策的话;「我们在 ChatGPT 里排第三」则是一件根本不存在的事。采样计划真正有用的产出有三个:分引擎统计你出现的运行占比、那些反复被引用而不是你的第三方来源清单,以及这两者在一个季度里有没有移动。这三样都扛得住波动;单一的排名主张扛不住。

我什么都没改,为什么 AI 可见性掉了?

最可能是引擎变了,而不是你变了。一项覆盖 230,000 条 prompt 的商业三个月研究记录到:2025 年某六周内,某个助手对一个大型讨论平台的引用率从约 60% 的回答骤降到约 10%,期间没有任何出版方做过任何动作。来源可用性也在变:2026 年一篇预印本(经批判性综述转述)发现,AI 答案中已被引用过的 URL 里有 27.1% 抓不下来,这个数字测的是“第三方研究者能不能抓到”,不是“引用它的那个引擎能不能抓到”。在归咎于自己的内容之前,先看看这批 prompt 的整体来源构成是不是整体移动了。

每个 AI 引擎的波动程度都一样吗?

不一样,而且引擎之间的分歧远大于引擎自身的前后分歧。SIGIR 2026 上发表的一项 11,500 条查询的研究报告:Google 自然结果、AI Overviews 与 Gemini 之间的平均 Jaccard 相似度低于 0.2,两两之间为 0.11–0.18;而同一界面内天与天之间的重合度是 0.34–0.42。跨引擎分歧才是更大的效应,所以结果必须按引擎、按界面分别报告,而不是平均成一个数字。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

一张截图只是一次抽样。
改成读那个分布。

免费试用