首页/学习 GEO/六个类别
提示词研究 · 分类

哪六个 prompt 类别应该分开跟踪?

一个只报综合数字的面板,是在给六个基础比率不同、“赢”的定义不同、修复动作所在位置也不同的群体取平均。构成一变,平均值就变。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

值得拆开的 prompt 有六类:品类定义、候选清单、对比、适配、异议、操作指南。它们在“你被点名的频率”“什么算赢”以及“引擎会检索哪些来源”这三点上都不同,所以一个综合出现率的变动,往往反映的是面板类别构成的变化,而不是你的可见性变化。对比类和异议类风险最高:Tow 中心对八个引擎、1,600 条查询的审计发现超过 60% 返回了错误答案,而一次挂着错误描述的引用比根本没被提到更糟。3

关键要点
  • 品类定义类和操作指南类可以由你自己的页面回答,候选清单类和异议类不行,对比类和适配类介于两者之间:正是这个划分告诉你团队里谁能动手。
  • “赢”在每一类里不是同一件事:候选清单类是出现在名单的任意位置,对比类是被准确描述,异议类是得到诚实的回答。单一的出现标记只对六类中的两类问对了问题。
  • 往一个 40 条的面板里加五条你本来就赢的品类定义类 prompt,综合出现率就从 37.4% 变成 41.0%,其他什么都没动,所以类别构成必须冻结,并写在数字旁边。
构成效应

为什么把六个类别平均掉会摧毁信号?

平均会摧毁信号,因为这些类别的基础比率差别很大,于是综合数字既是你的可见性的属性,也是面板构成的属性。用一个合理的 40 条面板算一遍:12 条品类定义类,你被点名的比例是 70%;10 条候选清单类,15%;8 条对比类,30%;4 条适配类,25%;3 条异议类,10%;3 条操作指南类,45%。综合出现率是 37.4%。现在再加五条你本来就赢的品类定义类 prompt,别的什么都不动,同一个面板报出来就是 41.0%:这 3.6 个百分点的上升,完全是一个编辑决定制造出来的。

第二个理由是,“赢”在每一类里不是同一件事。在候选清单类上,出现在名单里的任何位置就是全部结果。在对比类上,如果你名字旁边那句话是错的,出现本身一文不值。在品类定义类上,赢是被归进正确的品类,而不是相邻的那个。一个单一的出现率,对六类中的两类问对了问题,对另外四类问错了。

第三个理由是,这些类别是从不同的来源群体里被回答的,因此它们响应的是不同的工作。品类定义类和操作指南类的答案,靠的是一家公司写得出来的页面;候选清单类和异议类的答案,靠的是它写不了的页面。把它们报成一个数字,只会告诉你“有东西动了”,却不告诉你哪个团队本来能推动它。提示词研究这一阶段 讲怎么把面板建起来;本文讲的是面板每一行上贴的那个标签。

分类法

这六个类别是什么,各自“赢”指什么?

六类是:品类定义、候选清单、对比、适配、异议、操作指南;每一类都自带一套“赢”的定义:被点到名、出现在名单里、被准确描述、与你真实的适用边界对上、被诚实回答、你的方法被当作那个方法引用。

类别买家会敲进去什么什么算赢修复动作通常在哪里
品类定义“X 是什么?” · “做 Y 的是什么工具?”被点到名,并归入正确的品类你自己的页面与百科类条目
候选清单“做 Y 最好的 X” · “Z 的顶级工具”出现在名单里,位置不限你控制不了的第三方合集
对比“X 对比 Y” · “X 的替代品”被准确描述,而不只是出现各占一半:你的页面加第三方文章
适配“X 适合五人团队吗?”你真实的适用边界被正确陈述你自己的页面,前提是边界写下来了
异议“X 安全吗?” · “用 X 会被封号吗?”诚实的答案,且出处来自可信方论坛与社区帖子
操作指南“我该怎么做 Z?”你的方法被当作“那个方法”引用你自己的文档与教程

六类里有两类值得单说一句“从自家域名有多大可能答得上”。目前公开发表的唯一一份 AI 引用分类研究,602 条受控 prompt 产生 21,143 条搜索层引用、覆盖三个助手,发现官方来源在它测过的每个平台上都是最大的一类,分别占引用的 34.22%、46.35% 和 44.07%。8 这就是品类定义类和操作指南类 prompt 价值的上限所在:这些恰恰是你自己的文档有资格回答的问题,也是官方来源占比最高的地方。

每条 prompt 只打一个类别标签。一个确实横跨两类的问题,比如“对小团队来说 X 和 Y 哪个更安全”,同时是对比、异议和适配,应该拆开,因为回答它们的来源群体不同,而一条合并的 prompt 会同时污染两个类别的比率。同一项研究还测到,一条答案本身携带多少来源,在不同引擎之间差别很大:三个助手每条回答的平均引用数分别是 6.88、12.06 和 16.35。8 也就是说,在还没考虑到你之前,一条候选清单类 prompt 在某个引擎上的位置数就是另一个引擎的两倍以上,这也是类别比率必须按引擎分别汇报、绝不合并的理由。

被错误呈现

为什么对比类和异议类风险最高?

因为在这两类上,一次挂着错误描述的引用,代价比根本没被引用还大,而错误描述是常态。哥伦比亚大学 Tow 数字新闻中心在 2025 年 3 月对八个引擎跑了 1,600 条查询,发现超过 60% 返回了错误答案;最差的引擎错误率高达 94%,在它的 200 条 prompt 中产生了 154 条指向错误页面的引用,而表现最好的那个也有 37% 出错。3 它更早的一次 200 条直接引文测试发现,153 条回答部分或完全错误,而系统只有 7 次表达了不确定。2

另有两项独立测量,把同一个问题落到了句子这一层。较早的研究发现,生成式搜索答案中只有 51.5% 的句子被其所挂引用完全支撑;4 2026 年一项研究把 98,020 条原子性主张中约 11% 归类为支撑不足。5 一个把你的品类说对、却把你的价格档说错的引擎,产出的仍然是一个会丢单的答案,而“是否出现”这个标记会把它记成一次胜利。

由此有三条便宜的操作后果。在对比类和异议类 prompt 上,记录完整的答案正文,而不只是出现标记,因为你真正需要读的是那句话,不是那个布尔值。这两类要用更高的运行次数来跑,因为你要从同一批运行里估两个比率,你出现的频率和描述正确的频率,而后者需要人工抽读。另外,在异议类上要预期修复动作落在你的域名之外:“用 X 会被封号吗”的诚实答案,通常是从一条社区帖子里检索来的,那属于站外 GEO这一阶段 的地盘,而不是你内容团队的。

那条平线

为什么候选清单类几乎不响应站内工作?

因为在“最好的 X”这类问题上,引擎引用的绝大部分是别人的页面,这把杠杆放到了你的域名之外、也放到了你的发版节奏之外。有两份厂商数据指向同一结论。其中一份考察了某个主流助手在 2025 年 9 月引用最多的 1,000 个页面,报告说其中只有约三分之一落在企业真有可能参与竞争的类别里。11 另一份在 2026 年 3 月至 6 月间跟踪了四个品牌的 7,683 个页面和 47,097 条引用,结论是一个品牌大约只拥有“关于它被引用的内容”的 2%。12 两份都是厂商发布、未经同行评议;那个四品牌的数字只是示例,不是常数。

把它们和上面那份学术分类研究放在一起,那里官方来源占引用的 34% 到 46%,两者看上去矛盾。其实不矛盾,而这正是本文的要点:官方来源占比是 prompt 类别的属性,不是整个网络的属性。一个定义性问题会拉来官方页面;一个“最好的某某工具”问题会拉来合集。目前没有人发表过“按 prompt 类别拆分的官方来源占比”,所以请把这个落差当作“必须拆开类别”的论据,而不是当作任一方向上的定论。

实际后果是一个诊断,而不是一个技巧:如果你的面板大部分是候选清单类 prompt、而曲线是平的,那条平线告诉你的是“答案是从哪里取来源的”,而不是“你的内容不好”。自己发一个合集页面,是在这一类的少数份额里竞争;让别人的清单里准确地写上你,是在多数份额里竞争。

噪声下限

为什么你什么都没变,某个类别的比率却动了?

因为一个类别比率所依赖的三件事里,有两件属于引擎而不属于你。第一件是引擎到底会不会给出 AI 答案:一项覆盖 55,393 条查询的 Google AI Overviews 研究测到,整体触发率是 13.7%,而在问句形式的查询上升到 64.7%。5 六个类别的措辞并不一样:品类定义类、适配类和异议类天然是问句,候选清单类通常是名词短语。所以一个类别显得平,可能只是因为它的 prompt 很少触发答案,这是分母问题,因此日志要把“有没有出现答案”和“答案里有没有你”分开记录。

第二件是,一个类别背后的来源群体既不是那份排序结果,也不是一个稳定集合。Google 的文档说明,AI Overviews 和 AI Mode 可能把一条 prompt 扇出成若干条围绕子话题的检索,10 而同一份审计发现,被引用的域名里有近 30% 根本没有出现在第一页结果中。5 一份 11,500 条查询的基准测试报告了 Google 自然结果、AI Overviews 与 Gemini 之间 URL 层面 0.11 到 0.18 的 Jaccard 相似度,以及同一条查询跑两次时更低的一致性。6 另有跨三个引擎的重复采样发现,域名之间许多看起来的差异其实落在噪声下限之内。9 在把一次类别变动算到你自己头上之前,先拿它跟这条噪声下限比一比。

操作规则

怎样打标签、分类汇报,又不把面板灌水?

在把一条 prompt 加进面板的那一刻,给它打上且仅打上一个类别标签,并在这条 prompt 的整个生命周期里冻结这个标签;然后按引擎、按类别公布比率,并在旁边写上样本数。冻结比听上去更要紧:在季度中途给一条 prompt 改标签,会同时悄悄改变两个类别的分母,而两边随之出现的变动是一个假象,你会花一周时间去解释它。

分类别汇报要花掉样本量。十条 prompt 各跑五次是 50 次观测,在 50% 出现率下对应约 ±14 个百分点的 95% 区间,宽到 30% 和 44% 两个类别比率其实是同一个测量结果。同一批运行在面板层面得到的数字要紧得多,所以面板留作头条指标,类别拆分留作诊断。规模计算见姊妹篇

还有三条规则能让这个标签保持诚实。在两个周期之间,把各类别的条数大致保持不变,并把它记进面板版本里,好让读者看到产出这个数字的构成。绝不要在一个你同时宣称有改善的周期里去重新平衡类别构成,因为本文开头那套构成算术会替你造出一个“改善”。还有,把类别留在日志里,而不是事后从 prompt 文本反推出来:这个标签是当初那个知道“为什么加这条”的人做出的一次判断。

本文的诚实边界

这个六分法是一个可用的约定,不是一件经过验证的量表。没有任何公开研究按这种方式给 AI 答案的 prompt 分层,因此也没有外部估计能告诉我们各类别的基础比率究竟差多少。上面 37.4% 到 41.0% 那个例子是基于合理输入的算术,不是测量结果。两个都很讲道理的团队,可能一个分五类、一个分八类。不可省略的是:必须存在某种拆分,并且你公布的任何数字都要带上它的类别构成,因为一个把构成藏起来的综合出现率,可以靠改面板而不是靠赢得什么来被推高。

产品在哪里派得上用场,在哪里派不上

分类这件事是免费的:在你的 prompt 表里加一列类别,给每一行打一次标签,然后按引擎报六个比率而不是一个。没有任何软件能替你打这个标签,因为一条 prompt 属于哪一类,取决于它当初为什么被加进面板,而这存在于那个亲耳听到买家这么说的人的脑子里。Bavior 按计划把一组固定的 prompt 打到五个引擎上,并记录每条答案引用了哪些来源,这让“每个类别的来源群体”变成看得见的,而不是猜出来的;当被引用的来源是一条活跃的讨论帖时,它会用你掌控的账号起草回复,在任何内容发出之前由你审批。它不替你决定分类法,不读你的销售通话,也无法告诉你描述你产品的那句话准不准:那需要人来读,抽样读。免费 AI 可见性检测免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 29 日)。

出处,全部核查于 2026 年 8 月 29 日
  1. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(综述预印本):arxiv.org/abs/2607.14035
  2. 哥伦比亚大学 Tow 数字新闻中心,《How ChatGPT Search (Mis)represents Publisher Content》,2024 年 11 月;来自 20 家出版机构的 200 条引文,153 条回答部分或完全错误:cjr.org
  3. Jaźwińska 与 Chandrasekar,《AI Search Has a Citation Problem》,Tow 中心,2025 年 3 月 6 日;八个引擎、1,600 条查询,超过 60% 错误:cjr.org
  4. Liu 等,2023;生成式搜索答案中只有 51.5% 的句子被其所挂引用完全支撑(见出处 1 的综述转述)
  5. Xu、Iqbal 与 Montgomery,2026;55,393 条趋势查询,采集于 2026 年 3 月 13 日至 4 月 21 日;AI Overviews 整体触发率 13.7%,问句形式查询为 64.7%;98,020 条原子性主张中约 11% 支撑不足(预印本):arxiv.org/abs/2605.14021
  6. Grossman 等,SIGIR 2026;11,500 条查询的代表性样本;Google 自然结果、AI Overviews 与 Gemini 之间 URL 层面的 Jaccard 为 0.11–0.18:arxiv.org/abs/2604.27790
  7. Kirsten 等,Findings of ACL 2026;把 Google AI Overviews 与自然搜索及五个生成式系统作对照的审计:aclanthology.org/2026.findings-acl.526
  8. Zhang、He 与 Yao,《From Citation Selection to Citation Absorption》,arXiv:2604.25707(预印本,仅描述性统计);602 条受控 prompt,21,143 条搜索层引用:arxiv.org/abs/2604.25707
  9. Sielinski,《Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement》,2026 年 3 月,arXiv:2603.08924(预印本):arxiv.org/abs/2603.08924
  10. Google Search Central,《AI features and your website》,更新于 2025 年 12 月 10 日(查询扇出与准入条件;第一方文档):developers.google.com/search/docs/appearance/ai-features
  11. 某厂商研究:某主流助手在 2025 年 9 月引用最多的 1,000 个页面中,约三分之一落在企业可参与竞争的类别里。厂商发布,不外链。
  12. 某厂商研究:2026 年 3 月至 6 月间,四个品牌,7,683 个页面与 47,097 条引用;一个品牌大约只拥有“关于它被引用的内容”的 2%。厂商发布,不外链。
常见问题

你想知道的,都在这里。

如果我同时公布分类别拆分,还能报一个综合的 AI 可见性数字吗?

两者一起公布没问题,前提是那个综合数字随身带着它的类别构成和产出它的面板版本。真正的问题不在于取平均本身,而在于两个周期之间构成变了:往一个四十条的面板里加五条你本来就赢的品类定义类 prompt,就能把综合出现率抬高好几个百分点,而你的可见性一点没变。如果构成被冻结并写明,这个综合值是一个合法的汇总;如果构成可以随意变动,它就是一个披着指标外衣的编辑决定。

小团队应该从哪一类开始?

从异议类和对比类开始,因为这两类一旦答错就是丢单,而且你几乎没有别的渠道会知道。“X 安全吗”或者“X 和 Y 比怎么样”被答错,会在买家联系你之前就把他劝退,而你的分析后台里不会留下任何记录。品类定义类和操作指南类是你自己的页面能推动的,所以适合排第二。候选清单类对小团队来说放到最后,不是因为它不重要,而是因为那份活在站外,而且很慢。

每一类需要多少条 prompt?

十条 prompt、每条跑五次,是实际可用的下限,在 50% 出现率下对应约 ±14 个百分点的 95% 区间,足以看出类别层面的大幅变动,不足以看出小幅变动。十二条跑十次能收到约 ±9。低于十条时,类别出现率描述的是那几条 prompt,而不是那个类别。同一批运行在面板层面的数字要紧得多,所以面板留作头条指标,类别拆分留作诊断用途,而不是 KPI。

一条同时属于两个类别的 prompt 该怎么办?

把它拆成两条,每类一条,并且各自按买家真会单独问出口的方式来写。像“对小团队来说 X 和 Y 哪个更安全”这样的问题,同时是对比、异议和适配三类,而引擎为这三种意图检索的来源并不一样,所以一条合并的 prompt 会给出一个你无法归到任何类别的答案,并且同时污染两个类别的出现率。拆开的代价是面板里多一行、每个周期多跑一次,这是整套方法里最便宜的一个修复。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

六个类别,六个比率。
一个综合数字什么也说明不了。

免费试用