首页/学习 GEO/第三方页面
站外 GEO · 机制

为什么第三方页面主导了候选清单类问题?

不是因为独立作者比你更被信任。一个要“若干个被点名选项”的问题,由一份本身就含有若干个的文档来回答更合适,而你的文档只含一个。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

候选清单类问题要的是一组被点名、且各自带理由的选项,而厂商页面是一份只讲一个选项的文档;所以在任何人评判谁的文笔更好之前,榜单就已经与“实际被发出的那条查询”更匹配。这个不对称是结构性的,不是编辑水平的问题,这也正是它对“把自己的页面重写一遍”毫无反应的原因。在目前对 AI 引用最细的一份公开拆解里(覆盖 21,143 条搜索层引用),在答案中承担对比工作的引用在该研究的影响力代理指标上均值为 0.1524,而只作为泛引用的为 0.0529,是其语义角色表里差距最大的一对。1

关键要点
  • 成因是查询与文档的匹配,不是可信度:要用一堆单厂商页面拼出一个集合,引擎必须先找到每个候选、再判断谁该进来、最后自己造出这份对比。一份榜单把这三件事一次性交付。
  • 定义类和 how-to 类问题不是这样,因为它们需要的证据只围绕一个主体,而这恰恰是你自己的文档最适合发布的形态。
  • 那份研究里读作 34.22% 到 46.35% 的那一列,标签是 Official,它涵盖答案中出现的每一个机构自己的站点,而不是“单个品牌拥有一个答案多少份额”。
  • 没有任何已发表的研究按问题类别拆分过“第一方引用占比”,而市面上流传的相关百分比都不带方法说明。
  • 买下候选清单页上的一个位置,与凭实力赢得它是两笔不同的交易;凡是平台或社区要求披露商业关系的地方,披露都是必须的。
结构性论证

为什么候选清单类问题与你自己的页面并不匹配?

因为这两份文档回答的根本不是同一个问题。“五人团队最好的项目跟踪工具”要的是一个集合:若干个被点名的候选,每个都带一条理由,并且有一条“到这里它就不再是对的选择”的边界。而厂商页面是一份关于单一实体的文档,它的任务是结束比较,而不是进行比较。检索是拿文档去对“实际被发出的那条查询”打分的,所以一份本身就长成答案形状的页面,在结构上就赢下了这次匹配,这发生在质量或信任被称量之前。

换到引擎那一侧去看这次失败,它就不再像是对你文笔的判决。要用一堆单厂商页面搭出一份候选清单,系统必须分别找到每个候选、判断哪些候选根本该进这个集合、再从一堆“各自都是为了赢下这场比较而写”的文档里自己构造出这份对比。一份榜单把这三件事全部预先解决好交过来,而这里面没有一条要求那份榜单是独立的、写得好的,甚至也不要求它是新的。

这个领域唯一一份系统性综述对同一条边界给出了评级:它把“查询与文档的相关性、以及在上下文中的位置,是主要决定因素”评为置信度,把“一项白帽干预能在多个引擎上持久改善可发现性”评为3 与被发出查询的相关性,是这套系统里证据最强的那一块;而相关性恰恰就是单厂商页面在结构上欠缺的地方。

答案之前

在任何文字被写出来之前,这个问题经历了什么?

它被拆开,并被搜索了好几次。Google 在文档里写明 AI Overviews 与 AI Mode“可能使用一种‘查询扇出’技术”,“在多个子主题和数据源上发出多条相关搜索”;同一个页面还点明了这是为什么行为而建的:人们会问那些以前需要多次搜索才能问完的复杂问题,“从探索一个新概念,到比较各种选项,等等”。4 所以一个候选清单类问题走到检索面前时,很少还是一条查询;而它变成的那些子查询里,有好几条本身就是对比性的。

由这些子查询汇集起来的候选池,比结果首页宽得多。发表于 Findings of ACL 2026 的一项 4,706 条查询的 Google AI Overviews 审计(数据采集于 2025 年 9 月)报告:平均有 53% 被概览查阅过的域名不在自然结果前十,27% 不在前一百。6 SIGIR 2026 上一项 11,500 条查询的研究,测得 Google 自然结果、AI Overviews 与 Gemini 之间 URL 层面的 Jaccard 相似度为 0.11–0.18;Jaccard 是两个 URL 集合的交集除以并集。7 这两个数字都不是引用占比,但在这里指向一致:正在被汇集的那个池子,不是你品类的结果页。

而底下跑的仍然是普通的搜索:Google 的说法是,它“在 Google 搜索上的生成式 AI 功能,根植于我们核心的搜索排序与质量系统”。5 这套系统在做搜索一直在做的事,只不过面对的是一条你没能亲手写下的查询。

证据

引用数据到底支持什么?

比上面这套论证所需要的要少,但也不是没有。目前最细的一份公开拆解是一篇描述性预印本,覆盖 602 条受控 prompt、21,143 条搜索层引用与 18,151 个成功抓取的页面,用的是一个构造出来的影响力代理指标。1

这条引用在答案里承担的角色引用条数影响力均值
定义 definition1,6630.1531
对比 comparison1,7190.1524
证据 evidence6,2160.1235
例子 example1,4680.1047
背景 background5,5820.0801
泛引用 reference1,2980.0529

请先读左列再读右列。这些标签描述的是一条引用在某一个答案内部承担了什么工作,而不是它来自什么类型的页面,所以这里的“对比”是一份差事,不是一种体裁。页面侧的那张表方向一致:含有对比内容的页面均值为 0.1389,不含的为 0.0894,作者把这个相对差写作 +55.28%。1 他们对问题类型那张图的自述是:“在各类问题中,对比类问题的平均影响力最高。”

而这些都没有确立本文开头那句话。该研究并没有按问题类别把引用拆成第一方与第三方。它的影响力分数是一个观察性代理,由重复引用、出现位置靠前、覆盖的段落数与文本重合度构造而成,不是对“模型到底依赖了什么”的测量。作者还给自己的结论设了明确上限:只把直接计数和描述性对比当作实证发现,把因果性的优化处方留给尚未开展的干预实验。这些表格与这套结构性论证是相容的,但它们不是为检验它而建的。

对照

为什么定义类和 how-to 类问题不是这样?

因为这些问题需要的证据只围绕一个主体,而在单一主体上,你就是现成文档里最接近的那一份。问一个品类是什么,或者某个东西怎么配置,答案要的是一条定义和一套步骤,范围都锁定在单一实体上。在同一份数据里,带有定义标记的页面比不带的影响力均值高 +57.33%,带有 how-to 内容的高 +41.20%。1 这两种形态正是你自己的文档最适合供给的,而这就是整个不对称的全部:第三方并没有更受偏爱,只是每一类问题需要的证据,本来就由不同的人发布。

这里也是那个被引用最多的数字最容易被误读的地方。该研究的来源类型表报告:官方来源在 ChatGPT 上占引用的 34.22%,在 Google 的 AI 界面上占 46.35%,在 Perplexity 上占 44.07%,是与新闻、垂直并列的三类中最大的一类。1 这一列的标签是 Official,它统计的是答案里出现的每一个机构自己的站点:制造商、机构、政府部门,以及被点名的每一家厂商,而不是其中某一家。它还是按平台报告的,从来不是按问题类别报告的。所以它既不能被读作“你在一个答案里占多少份额”(那是另一个量级问题),也不能被读作“定义类问题拉取官方页面、候选清单类问题拉取榜单”的证据。那个按类别的拆分,正是没有人发表过的数字,六类 prompt 那一篇标出的也是同一个缺口。

你自己的榜单

你该不该自己发一份对比页?

它能过本文这道结构关,却过不了另一道关;所以发它可以,但理由不该是引用。你域名上一份真正的多产品对比是“集合形状”的,正好就是查询想要的,因此它具备一种你的产品页不具备的资格。它过不了的是选择那一关:对同一条子查询而言它只是众多候选之一,它带着显而易见的利益关系,而结果不取决于你。

关于最常见的那种反应,也就是不停重写,干预层面的证据并不乐观。NeurIPS 2025 的一项基准在逾 1.9k 条查询与 16k 份文档上测试了十种对话式 SEO 方法,报告称“在 54 个案例中,我们只发现三个排名提升具有统计显著性”。2 修改一个你已经拥有的页面上的文字,正是那一类持续无效的干预。改变“关于你的品类都存在哪些页面”,是另一类干预,而它诚实的版本很慢。

所以,发一份对比页站得住脚的理由是供给,而不是位置。做榜单的作者会略过那些价格、限制和适用边界无法核实的产品,而一个正在写对比的引擎同样得从某处拿到这些事实。一份给其他每个产品都写了读者真能据以行动的“最适合谁”、明说了自己一条真实局限、并且在免费方案确实更合适时就推荐免费方案的页面,对两者都可用。而一份除了你的产品之外全都很差的榜单,两者都用不上。

界线

“赢得一个位置”和“买下一个位置”的界线在哪里?

这套机制会诱出的结论是“那就想办法进第三方页面”,而这句话悄悄地装着两笔不同的交易。因为评测者判断你该在里面而被收录,是一回事。花钱买下那个位置,是另一回事:它买的是一份文档里的位置,而这份文档对读者、以及对代读者阅读的系统来说,其全部价值恰恰建立在“排名反映了某种判断”这一信念之上。凡是平台、出版方或社区要求披露商业关系的地方,披露都是必须的;这项义务不会因为受众里现在多了机器就变轻。

同一条界线也排除了另一条捷径。自己去做那份第三方页面,署上一个不披露关系的名字,那不过是你自己的页面披了别人的名头;读者第一次去核对它就失败了,而在社区平台上,把它清掉的是版主,不是某个你能跑赢的算法。边界那一篇会完整交代这件事,本页不再重复。

剩下的东西不体面但耐用。做到可核实,让评测者能确认一条主张,而不是把你略掉。在被广泛引用的榜单写错了你的价格或限制的地方去更正记录,这是这里回报最快、却没人排进日程的一件事。用真东西赢得报道,比如原创数据,或一个真有人用的工具。这些都不快,但下一次检索规则变化之后,它们都还在。

本文的诚实边界

本文的结构性论证是一种解释,不是一次测量。唯一能直接检验它的数字,也就是按问题类别拆分的“第一方对第三方引用占比”,至今没有任何人发表过;一个接近 80% 的“候选清单第三方占比”数字流传很广,却不带任何方法说明,上文也没有一处依赖它。那些影响力表格来自一篇描述性预印本,工作在单一数据集上,共 602 条 prompt、采集自一个时间窗,用的是作者自己再三称之为“代理”的指标;而在那份数据里,篇幅与结构也可能只是编辑质量的替身,而不是原因。请把任何附在这个机制上的百分比都当作未经证实,直到有人真的把它测出来。

产品在哪里派得上用场,在哪里派不上

这里的诊断是免费的,一个下午就够:把你商业价值最高的十个候选清单类问题在每个你在意的引擎上各跑一遍,记录每一个被引用的 URL,再把它们分成三堆,你拥有的页面、描述了你的页面、以及压根没提到你的页面。这份通常约十五个 URL 的清单,就是上面一切的具体版本。Bavior 按计划把一组固定的 prompt 打到五个引擎上,并记录每条答案引用了哪些来源,让这份清单保持最新,而不必手工重建;当被引用的来源是一条活跃的讨论帖时,它会用你掌控的账号起草回复,在任何内容发出之前由你审批。它不会把你放进任何人的榜单,不会去联系出版方,也无法购买、谈判或安排一次收录。免费 AI 可见性检测免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 30 日)。

出处,全部核查于 2026 年 8 月 30 日
  1. Zhang Kai、He Xinyue、Yao Jingang,《From Citation Selection to Citation Absorption: A Measurement Framework for Generative Engine Optimization Across AI Search Platforms》,2026 年 4 月 28 日(v2 为 4 月 29 日),arXiv:2604.25707(描述性预印本,公开数据集);602 条受控 prompt、21,143 条有效搜索层引用、23,745 条引用级特征记录、18,151 个成功抓取的页面;语义角色、证据体裁与来源类型三张表:arxiv.org/abs/2604.25707
  2. Puerto、Gubri、Green、Oh、Yun,《C-SEO Bench: Does Conversational SEO Work?》,NeurIPS 2025 数据集与基准赛道,arXiv:2506.11097;十种方法,逾 1.9k 条查询与 16k 份文档;原文为“out of 54 cases, we uncover only three where the ranking improvements are statistically significant”:arxiv.org/abs/2506.11097
  3. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(综述预印本);其置信度表把“相关性与上下文位置”评为高、把“跨引擎的持久收益”评为低:arxiv.org/abs/2607.14035
  4. Google Search Central,《AI features and your website》,最后更新于 2025 年 12 月 10 日(查询扇出、比较各种选项、摘要准入;第一方文档):developers.google.com/search/docs/appearance/ai-features
  5. Google Search Central,《Google’s Guide to Optimizing for Generative AI Features on Google Search》,最后更新于 2026 年 7 月 10 日(“根植于我们核心的搜索排序与质量系统”一句;第一方文档):developers.google.com/search/docs/fundamentals/ai-optimization-guide
  6. Kirsten 等,Findings of ACL 2026;对 Google AI Overviews 的 4,706 条查询审计,数据采集于 2025 年 9 月;原文为“on average 53% (27%) of domains that AIO consults are not contained in top-10 (top-100) Organic search results”:aclanthology.org/2026.findings-acl.526
  7. Grossman 等,SIGIR 2026;11,500 条查询的代表性样本;Google 自然结果、AI Overviews 与 Gemini 之间 URL 层面的 Jaccard 为 0.11–0.18:arxiv.org/abs/2604.27790
常见问题

你想知道的,都在这里。

这是不是说,我自己的网站对候选清单类问题就不重要了?

是重要,但方式不同。你的页面是可核实事实的供给端,做榜单的作者和引擎都要从这里取材;所以价格、限制和适用边界如果在任何地方都查不到,你就会在你根本看不见的比较里被略过。你的页面做不到的,是靠自己在一个“集合形状”的查询上赢得匹配,因为一份只讲一个产品的文档,回答的是比被提问的那个更窄的问题。

官方来源占 AI 引用的 34% 到 46%,这难道不能证明我自己的页面赢了?

不能,因为那一列统计的东西不是这个意思。它是一个来源类型标签,涵盖答案里出现的每一个机构自己的站点,包括各类组织和被点名的每一家厂商,所以它是被所有人分掉的,而不是被某一家握着。它还是按平台报告的,不是按问题类别报告的,因此它对“候选清单类问题是否与定义类问题表现一致”这件事什么都没说。

我该不该花钱进一份 AI 答案已经在引用的榜单?

请把它当成与“凭实力被收录”不同的一笔交易,并按这个前提去定价。付费位买到的是文档中的位置,而这份文档对读者的价值恰恰建立在“排名反映了某种判断”之上;凡是平台或社区要求披露商业关系的地方,无论读者是谁,披露都是必须的。关于这条边界的完整讨论,包括不披露作者身份的情形,见边界那一篇。

为什么定义类问题会拉取我的文档,候选清单类问题却不会?

因为这两类问题所需要的证据,是由不同的人发布的。一条定义或一套步骤的范围就是单一主题,而在单一主题上,你自己的文档就是现成文档里最接近的那一份。候选清单需要的是横跨若干个被点名选项的对照性证据,任何单一厂商的页面都不含有这种东西,所以最接近的那份文档只能是别人的。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

答案里的大部分,是别人写的。
先弄清在你的品类里,是哪几个页面。

免费试用