哪些 prompt 来源值得用来搭建面板?
有五个地方能产出真实买家说过的句子。它们质量不等,失效的方向也各不相同,而面板的组配方式,决定了你的可见性数字究竟能诚实地表示什么。
本页内容
真实的 prompt 来自五个地方,这里按信号质量排序:通话录音与支持工单、你自己带疑问词的搜索查询、头部词的扇出展开、你品类里的社区帖子,以及流失与丢单原因。给来源排序看三条属性:有真人留下问过它的记录、知道是谁在何时问的、措辞独立于你自己的营销话术。优先收集带疑问词的那些不是文体偏好:在 2026 年一项覆盖 55,393 条热门查询、历时 40 天的测量里,疑问句式查询有 64.7% 触发了 Google 的 AI Overview,非疑问句式只有 9.5%。6
关键要点- 可追证是你无法制造出来的属性,所以通话与支持工单排在没有任何人留下记录的另外三个来源之前。
- 要刻意组配:40 条的面板里,通话与工单 12 条、自己的查询 8 条、扇出 10 条、社区帖子 6 条、丢单 4 条,任何来源都不超过 40%。
- 没有人公布一条 prompt 被问了多少次,所以面板是你自己声明的抽样框,而不是某个已知总体里的一份占比。
- 要按引擎分开汇报:Google 自然结果、AI Overviews 与 Gemini 之间 URL 层面的重合度只有 0.11 到 0.18 的 Jaccard,把五个引擎平均掉就会把差异抹平。2
是什么让一个 prompt 来源优于另一个?
三条属性,谁占得多谁就更好:可追证、可归属,以及与你自己词汇的独立性。
可追证
有真人留下了“问过这句话”的记录。通话录音完全具备这一点;你靠展开头部词写出来的子问题则完全不具备,而这两者之间的落差,是 prompt 调研里最大的质量差异。
可归属
你知道是谁问的、什么时候问的。可归属性让你能说出“这个问题来自上个季度我这一类客户”,而不是“互联网上某个人在某个时候”,也正是它让面板日后可以被修剪。
独立性
措辞不是来自你。用你自家功能话术写出的问题,测的是引擎会不会复述你的营销文案,而这正是那种会产出一个不断上升、却毫无信息量的数字的失效方式。
这五个来源按顺序分别是什么?
按信号质量降序排列,其中前两个的价值超过后三个之和。
| 来源 | 它能佐证什么 | 典型产出量 | 它怎样失效 |
|---|---|---|---|
| 通话与支持工单 | 某个具名的人在某个日期用自己的话问过 | 每通电话 1–3 个不同问题;试用首周工单更多 | 只覆盖联系过你的人;沉默的大多数是看不见的 |
| 你自己带疑问词的查询 | 有人敲了这句话并到达了你的页面 | 数十条,且已归属到具体 URL | 只有 Google 的需求,而且稀有查询的长尾被扣着 |
| 扇出展开 | 谁都不能佐证,这些是重构出来的子问题 | 每个头部词 4–6 条,原则上无上限 | 看似合理却没人问的问题;这种失败是看不见的 |
| 社区帖子 | 某个买家在公开场合写给其他买家 | 量大,且偏向已经有排名的内容 | 幸存者偏差,以及本领域被测过的最不稳定的引用序列 |
| 流失与丢单原因 | 某个买家在离开时说出的话 | 很少,常常不到十条,而且条条高风险 | 事后合理化的理由;样本小,后果重 |
排序的第一依据是可追证,第二依据是独立性,这也是扇出尽管最好上手却排在第三的原因。每个来源都有自己的文章,本页只停在排序:通话与支持工单讲逐字原则,疑问式查询讲搜索控制台的筛选方式与被截断的长尾,扇出展开讲那条防止展开变成臆造的证据锚定规则,社区帖子讲它们为什么有双重价值,流失与丢单 prompt讲那些你永远不会听说的丢单。
有一条属性横跨全部五个来源,而且很容易被忽略:面板是按引擎存在的,不是全局的。SIGIR 2026 上一项 11,500 条查询的研究测得 Google 自然结果、AI Overviews 与 Gemini 之间 URL 层面的 Jaccard 相似度为 0.11 到 0.18;另一项对 1,008 条生成式搜索回答的审计发现,355 个不同域名中只有 26% 被 Bing Chat 与 Perplexity 同时引用。23 2026 年那篇批判性综述用一句话下了结论:“可见性是按引擎和界面索引的。”4
每条 prompt 究竟被问过多少次?
没有人公布这个数。没有哪个生成式引擎会报告有多少人问过某个问题,所以 prompt 面板没法像关键词清单那样按需求加权。
这种缺失是结构性的,而不是暂时的。2026 年那篇批判性综述描述了内容生产者实际所处的位置:他们通常观察不到被检索出的候选集合、重排分数,或生成器的内部状态,因而这是“一个信息不完全条件下的黑箱优化问题”。4 两项规模最大的独立测量都不得不自己构造查询样本:一项公开了 11,500 条用户查询的基准集,另一项在 40 天里发出了 55,393 条热门查询。26
你发出的那条 prompt,甚至都不是真正被拿去检索的单位。Google 自己的文档写明 AI Overviews 与 AI Mode 会使用一种“查询扇出”技术,“跨子话题与数据源发出多条相关搜索”。7 一条面板条目会变成好几条你根本看不见的搜索,所以就算给你的句子挂上一个热度数字,它描述的也不是真正跑起来的那些查询。
那就改按后果来排序:当引擎把这一条答错时,你要付出什么代价;并且把抽样框和数字一起公开。综述对已公布的比率也讲了同样的道理:两个 AI Overview 触发率数字,64.7% 与 51.5%,并不矛盾,因为查询分布不同,而且“一个没有说明样本的比率,可迁移性有限”。4 为什么不存在 prompt 量级把这套论证完整拆开讲了一遍。
每个来源该贡献多少条 prompt?
一份 40 条 prompt 的面板,站得住脚的起始组配是:通话与工单 12 条、你自己带疑问词的查询 8 条、扇出展开 10 条、社区帖子 6 条、流失与丢单 4 条。这些数字是一种约定而不是一项测量,背后的推理才是值得留下的部分:两个可追证的来源占了一半,因为可追证无法被制造;扇出拿到四分之一,因为只有它能触及“还没有人问过你的问题”;最后两份配额小,是因为社区帖子会过度代表已有排名的内容,丢单原因则确实稀少。
有两条上限比具体的配比更重要。任何单一来源不超过面板的约 40%,因为越过这个点,面板测的就是那个来源的偏差而不是你的买家。一个 80% 来自扇出的面板测的是你自己的想象力,一个 80% 来自社区帖子的面板追踪的是某个引擎对论坛的检索策略。每个 prompt 类别都要有代表,按提示词研究这一阶段给出的分类法来,因为一个缺了异议类的面板看上去会很稳,而那些让你丢单的问题从头到尾没被测过。
组配还必须经得起变更。当你增补或淘汰 prompt 时,请给面板升版本号,并让旧的组配与新的并行再跑一个周期,这样那道断层就是一个你能说出口的数字,而不是曲线上一次无声的污染。
为什么这是一项有定量产出的定性研究?
因为收集环节是定性抽样,只有测量环节是定量的,这就把最终数字的效力放在了抽样框上,而不是样本量上。你是在一个无法穷举的总体里、用自己挑的来源去收集话语,然后在收集到的东西上测一个比例。因此,一项好的定性研究的每条属性都适用:写清你怎么抽的样、说明谁被排除在外、把抽样框和估计值一起报出来。一份没有写明抽样框的 prompt 面板,就是一份没有方法章节的问卷调查。
测量那一半有自己的纪律,2026 年那篇批判性综述给出的“GEO 研究最低清单”写得很清楚:记录产品、模式、模型、日期、区域设置、账号,以及搜索是否开启;做时间上紧邻的重复运行,并跨多个时间窗;把检索、重排、上下文与生成分开;把空结果保留在分母里。4 最后这一条正是团队悄悄作弊的地方,因为把“什么都没发生”的运行删掉,就能在每个单独数字都技术上为真的前提下,把面板变成一份精彩集锦。2026 年一篇统计学论文补上了它为什么重要:引用分布服从幂律,而域名之间许多表面上的差异都落在测量过程的噪声本底之内。5
由此得出的结论值得写进你自己的报告里。同一品类的两个团队,各自诚实地抽样,会建出不同的面板、公布不同的可见性数字,而且两边都不算错。你的面板测的是你买家的问题,不是整个品类的问题,这既是把你自己的面板公开出来的好理由,也是不要相信“全市场可见性排行榜”的更好理由。
一条建好的面板条目长什么样?
七个字段。前两个正是团队会跳过、事后又后悔的:逐字原文,以及它从哪里来。
逐字原文与规范化文本
两个都留。逐字原句是证据,规范化后的那条才是你实际去跑的。只存规范化版本,会让你日后再也无法检查自己是不是把意思改了。
来源、日期与说话人类型
来自五个来源中的哪一个、什么时候收集的、说这话的是哪一类买家。正是这些信息,让你能淘汰一个措辞已经过时的问题,而不是靠猜。
类别、面板版本与变体
每条 prompt 一个类别标签、它进入面板时的版本号,以及你合并进来的那些近似表述及其计数。变体清单才是告诉你“哪种说法更常见”的东西。
去重是面板悄悄丢掉抽样框的地方,所以在开始合并之前,先把规则写明白。当一位称职的销售会对两条给出同一个回答时,它们是同一条 prompt;回答只要有差别,它们就是不同的 prompt。按最常见的表述合并,保留带计数的变体,并且绝不跨类别合并:“安全吗?”和“我该怎么安全地把它装起来?”看着相邻,承担的风险却不同。
本页上的排序是推理出来的,不是测出来的。没有人做过这样一项研究:把用不同来源建出的面板,对照“买家真正会问引擎什么”的基准真值来比较,因为那个基准真值,正是上一节所说的、没有人公布的东西。三条标准站得住脚,排序也由它们推出,但一个销售通话并不具代表性的团队,完全有理由把前两名对调。那些组配数字是一种带推理的约定,不是一项发现;请用你自己漏斗里的证据去调整。
本页上的每一个来源,要么就在你自己公司内部,要么免费可读,而整套方法就是一张七列的表格,外加一周读通话记录的时间。请先做这件事:手工建起来的面板,才是让日后任何测量有意义的东西。Bavior 无法替你建它。它拿不到你的通话录音、你的工单或你的丢单记录,它不替你挑 prompt,也无法告诉你你的抽样框是否具代表性。它做的是重复的那部分:一份固定面板按计划跨五个引擎运行,记录每一个被引用的 URL,让你看清缺口是在你的页面上还是在别人的帖子里;当被引用的来源是一条活跃的讨论帖时,它会用你掌控的账号起草回复,在任何内容发出之前由你审批。免费 AI 可见性检测和免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 29 日)。
- Zhang、He 与 Yao,《From Citation Selection to Citation Absorption: A Measurement Framework for Generative Engine Optimization Across AI Search Platforms》,2026 年 4 月,arXiv:2604.25707;602 条受控 prompt、21,143 条有效搜索层引用;官方来源从 ChatGPT 的 34.22% 到 Google 的 46.35%(预印本,仅描述性统计):arxiv.org/abs/2604.25707
- Grossman 等,SIGIR 2026;公开的 11,500 条用户查询基准集;Google 自然结果、AI Overviews 与 Gemini 之间 URL 层面的 Jaccard 为 0.11–0.18;51.5% 的查询出现 AI Overviews:arxiv.org/abs/2604.27790
- Li 与 Sinnamon,2024;对 1,008 条生成式搜索回答的审计;识别出 355 个不同域名,其中 26% 被 Bing Chat 与 Perplexity 同时引用(学术研究,见出处 4 的综述转述)
- 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(GEO 研究最低清单;信息不完全条件下的黑箱优化;可见性按引擎与界面索引):arxiv.org/abs/2607.14035
- Sielinski,《Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement》,2026 年 3 月,arXiv:2603.08924(预印本):arxiv.org/abs/2603.08924
- Xu、Iqbal 与 Montgomery,2026;55,393 条热门查询,采集于 2026 年 3 月 13 日至 4 月 21 日;AI Overview 整体触发率 13.7%,疑问句式查询 64.7%,非疑问句式 9.5%(预印本):arxiv.org/abs/2605.14021
- Google Search Central,《AI features and your website》,更新于 2025 年 12 月 10 日(“查询扇出”技术,跨子话题与数据源发出多条相关搜索;第一方文档):developers.google.com/search/docs/appearance/ai-features
- 社区帖子引用研究,2025 年 11 月:217,000 条 prompt 中出现的 248,000 个被引用的 Reddit URL;被引用的帖子平均约 900 天前发布、约 80 词,80% 的赞数不到 20。厂商发布,按本课程的出处规则只描述不链接。
- 最常被引用页面研究,2025 年 10 月:某助手在 2025 年 9 月引用最多的前 1,000 个页面里,28.3% 完全没有自然关键词可见度。厂商发布,按本课程的出处规则只描述不链接。
你想知道的,都在这里。
我能只用一个来源建面板吗?
可以,但那样一来,面板测的就是那个来源的偏差,而不是你买家的问题。每个来源失效的方向都不同:通话只触达联系过你的人;搜索控制台只看得见 Google 的需求,而且稀有查询的长尾被扣着;扇出展开什么都不能佐证,因为是你自己写的;社区帖子会过度代表本来就有排名的内容;丢单原因既稀少又是事后合理化的。把任何单一来源控制在面板的约 40% 以下,就是在阻止其中某一种失效方式变成整个测量。
我怎么知道 prompt 收集够了?
当继续收集不再产出新的、不同的问题时,就停止扩展来源;当置信区间窄到足以据此行动时,就停止扩大面板。这是两条彼此独立的停止规则,而且都重要:前者是定性研究里的饱和检验,你可以把“每一批通话新增的不同问题数”画成曲线来观察;后者是算术,40 条 prompt、每条在每个引擎上跑 5 次,在 50% 出现率附近大约是正负 7 个百分点的区间。一个面板可以在统计上足够,却依然错过你买家真正会问的问题,所以饱和要排在前面。
用 AI 模型来生成 prompt 想法算作弊吗?
用模型去扩展一份你已经用真实通话打底的清单是合理的;用它来从零生成清单则不行,而且这种失败是系统性的,不是随机的。让语言模型给出示例问题时,它是在从训练分布里采样,而那个分布被“你这个品类已经被公开书写的方式”所主导,于是它会返回那些已被充分覆盖的问题的中位表述,并且恰恰少产出那些还没有人写过的问题,而后者正是你隐形的地方。判断标准不变:如果你指不出一个说过类似句子的真人,这条就该归入扇出那一类,并标注为“重构而来”。
同一份面板要在每个引擎上都跑吗?
同一批 prompt 在每个引擎上都跑,但结果要分开汇报,绝不合并。合并会摧毁信息,这一点有直接证据:SIGIR 2026 上一项 11,500 条查询的研究测得 Google 自然结果、AI Overviews 与 Gemini 之间 URL 层面的 Jaccard 相似度为 0.11 到 0.18;另一项 1,008 条回答的审计发现,Bing Chat 与 Perplexity 之间只有 26% 的域名是共有的。一个混合出来的“AI 可见性”百分比,是在把五个检索行为各异的系统平均掉,而它的涨跌你将无法归因到自己做过的任何事情上。
负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。
发现数字有误?告诉我们,我们会重新核查:support@bavior.com