首页/学习 GEO/反模式
提示词研究 · 反模式

为什么你的功能清单是错误的 prompt 面板来源?

因为用你自己词汇写出的面板,测的是引擎会不会复述你的营销文案,而它们通常会。它产出的数字会随着你发得更多而上涨,而且可能在你真实可见性下滑的同一个季度里上涨。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

一条用你自身定位话术写出的 prompt 是一条自指 prompt:它的措辞基本只出现在你拥有的页面上,因此几乎不存在竞争语料,检索返回你的页面,答案点你的名。这样建起来的面板,会报出一个接近区间上沿、并且随着你发布内容而上涨的出现率,它测的是你自己的内容库存,而不是一个陌生人眼中的你。这个领域唯一一份受控基准里,54 个案例中只有 3 个取得了统计显著的排名提升;而在其零售领域,把一个来源移到上下文第一位平均能提升 2.77 个名次,而最佳内容改写只有 0.36 个名次。3

关键要点
  • 「自指」指的是措辞来自你的营销而不是买家:一个你造的词、一个只有你站点在用的功能名,或一种因为你写了它才存在的问题表述。
  • 这个比率会自己往上走:官方页面本来就是被引用最多的类别,发布内容会不断增加只有你在用的词汇,而面板是靠添加而不是靠替换来增长的。
  • 两项机械检查能了结大多数争议:去掉品牌名再跑一遍,然后把这段措辞原样搜一下,看回来的是谁的页面。
  • 把可追证条目与自指条目作为两个比率分别汇报,绝不合成一个头条数字;品牌类 prompt 控制在四条左右,并按准确性而不是按是否出现来打分。
机制

用自家定位话术写出的面板,问题出在哪?

用自家定位话术写出的面板,问的是只有你自己的页面能回答的问题,然后把“你自己的页面回答了它们”这件事,记录为可见性的证据。那是一个挂着百分比的同义反复。所谓自指 prompt,就是措辞取自你的产品营销、而不是取自任何买家说过的话:里面有一个你造的词、一个只有你站点在用的功能名,或者一种因为你写了它才存在的问题表述。这类问题的竞争语料几乎为空,所以检索也几乎无处可去。

它之所以如此可靠地奏效,是有文档依据的,而不是理论推测。Google 表示其搜索里的生成式功能“根植于我们核心搜索的排序与质量系统”,8 并且一个页面要有资格出现,“必须已被收录,且有资格带摘要出现在 Google 搜索里”。1 因此,是普通的排序在决定哪些页面成为候选,而你在自己的词汇上几乎按定义就排第一。2026 年那篇批判性综述把“查询与文档的相关性、以及在上下文中的位置是主要决定因素”评为高置信度。2 一条由你自己的词造出来的 prompt,恰好把这种相关性推到最大,而受益的只有一份文档,正好是你的。

它为什么会往上漂

这个数字为什么会自己往上走?

有三种机制会让一个自指面板随时间上行,而其中没有一种是“你的可见性变好了”。

01

官方页面本来就是被引用最多的类别

在一项 602 条受控 prompt、产出 21,143 条搜索层引用的研究里,被它归为“官方”的来源是最大的单一类别:在 ChatGPT 上占 34.22%,在 Google 上占 46.35%。引擎很乐意去拿那个官方页面。

02

发得越多,你自己的措辞覆盖得越全

每一个新页面都会带来只有你在用的词汇,也就带来一批“只要有人把它写成 prompt,你就必赢”的问题。这个比率跟着你的发布日历走,而不是跟着买家找到你的方式走。

03

面板是靠添加而不是替换来增长的

自指 prompt 最好写,所以面板扩容时被加进来的就是它们。分母的构成在无声地变化,而头条数字在没有任何一条答案改变的情况下上涨。

让第一种机制从“有帮助”变成“决定性”的,是在受控测试里“位置”对其余一切的压倒性优势。2026 年那篇批判性综述概括了为这个问题而建的唯一一份基准:在两类任务、六个领域、约 1 900 条查询与 16 360 份文档上,54 个方法与领域组合中只有 3 个显著为正。2 基准本身,也就是 NeurIPS 2025 的 C-SEO Bench,测试了十种方法;在它的零售领域里,把一个来源移到上下文第一位平均能提升 2.77 个名次,而所测最佳内容改写只有 0.36 个名次。3 把它当作关于自指 prompt 的一句话来读,结论毫不含糊:在你自己的词汇上,你本来就占着第一位,所以这条 prompt 测的是一个你丢不掉的杠杆,而不是一个你能拨动的杠杆。

算术

被污染的数字长什么样?

一个被污染的面板数字长这样:头条出现率从 41% 爬到 45%,然后在真实可见性下滑四分之一的情况下停在 42%。下面用虚构但贴近现实的输入算给你看,这是示范算术,不是数据。

面板版本真实 prompt自指 prompt头条出现率
v1,40 条28 条,20%12 条,90%41%
v2,又加了四条28 条,20%(未变)16 条,90%45%,什么都没变好
v3,一个季度之后28 条,15%(下滑)16 条,90%42%,仍高于起点
你本来想要的那个面板40 条,20%没有20%,而且现实一动它就动

值得多坐一会儿的是 v3 那一行:真实 prompt 的出现率掉了四分之一,头条数字却仍然高于起点。这张表里没有任何一处需要恶意。每一版都是某个人加进了看起来合理的 prompt,而其中每一个单独的数字都是对的。污染完全发生在分母的构成上,这也是来源排序那一篇坚持“任何单一来源不超过面板约 40%”、并坚持“组配一变就升版本号”的原因。

防线是算术,不是警觉。请把可追证的那一半与自指的那一半作为两个比率分别汇报,这个效应就消失了:一个从不动的切片和一个会动的切片并排看很有信息量,平均之后则会误导人。2026 年一篇关于 AI 可见性测量的统计学论文讲的是这件事的一般形式,它提醒:引用分布服从幂律,而许多表面上的差异都落在测量过程的噪声本底之内。4 一个混合出来的头条数字,会把这两个问题一次性藏起来。

检验

怎样把自指 prompt 和真实 prompt 区分开?

对措辞问三个问题,再跑两项机械检查,每条 prompt 大约十五秒就能分类完。里面有你造的词吗?一个功能名、一个方法论名、一个你为定位材料发明的品类标签。一个从没听说过你的买家会敲它吗?把它当作买家念出来;如果它只有读过你首页的人才看得懂,那就是自指的。你能指出一个说过类似话的真人吗?这就是给其余每个来源排序时用的那条可追证检验,也是能了结争论的那一条。

两项机械检查能抓住判断力漏掉的东西。把你的品牌名去掉再跑一遍:如果名字不在时这条 prompt 依然能把你检索出来,说明这个问题真的是关于品类的;如果它塌成一个点了另外五家公司名字的通用回答,那你测的是自己的品牌,而不是自己的主题。把这段措辞原样搜一下,看回来的是谁的页面:如果每条结果都是你自己的,说明不存在竞争语料,这条面板条目只能告诉你自己的站点有没有被收录。两项检查各花一分钟,都不需要工具。

检查解决不了的是那个常见的边界情形:一个由你带火、而买家确实采用了的说法。请把“是否被采用”当作一个经验问题,而不是一个让人得意的假设。如果这个说法出自买家之口出现在你的通话逐字稿里,它就被采用了,这条 prompt 是可追证的;如果它只出现在你自己的营销材料和链接到你的页面上,那就还没有。

补救

一个已经被污染的面板,该怎么重建?

在改动任何东西之前,先把面板冻结并给它一个版本号,因为条目一旦在没有版本号的情况下变化,你就彻底失去了跨季度比较的能力。接着用上面那两项检查给每一条条目分类,并把判定结果存进面板本身,让分类是可审计的,而不是靠记忆。然后按新的拆分方式重述历史,而不是重述那个混合值:把可追证比率回填到此前的每一次运行上,让自指比率作为第二条序列并排放着,永远不并入平均。

在有人宣布“修正后的数字动了”之前,还有一句提醒。对同一批查询在三个生成式搜索平台上的重复采样发现,引用分布服从幂律,而许多域名之间表面上的差异都落在测量过程的噪声本底之内。4 一个干净的面板,仍然需要跑好几轮,一次变化才算得上变化。

例外

面板里该不该有品牌类 prompt?

该有:一个固定的、独立汇报的小桶,因为品牌类 prompt 回答了一个别的类别都回答不了的真实问题:当引擎描述你时,描述准确吗?这个问题很重要,而证据表明它不该被默认为“准确”。Tow 中心对八个引擎、一千六百条查询的审计发现其中超过 60% 返回了错误答案;更早的一次两百条引文测试中,153 条回答部分或完全错误,而模型只有 7 次表达了不确定。5 那些研究测的是新闻归因而不是产品描述,所以请把它们当作“该去核查”的理由,而不是对你自身错误率的估计。

这个桶的规则很严,因为它的出现率按构造就没有信息量。请把它控制在四条左右,按准确性而不是按是否出现来打分,用异议 prompt 那篇里的三值结果,并且绝不让它们进入头条数字。一项针对某助手 2025 年 9 月引用最多的前 1,000 个页面的厂商分析发现,其中首页与落地页占 23.8%,并得出结论:最常被引用的页面里,只有约三分之一落在一家企业能够现实地参与竞争的类别中。6 你自己的页面很容易被引用;那是关于引擎的一个事实,不是给你的一个分数。

这一切背后的一般原则值得直说,因为它的适用范围远不止 prompt 面板:一个由你控制输入的指标不是测量。当你可以靠多写几篇自家文案把一个数字抬上去时,这个数字就已经不再描述外部世界了;而 2026 年那篇批判性综述里置信度最低的那一行提醒了这道缺口能有多大:它把“引用分数能预测点击、转化或收入”评为极低置信度。2

本文的诚实边界

没有人测量过真实的 prompt 面板被污染到什么程度,因为面板是私有的,也不存在关于它们的数据集。这里论证的机制,是从两件被测量过的事情推出来的:官方页面是被引用来源中最大的单一类别,以及相关性与上下文位置主导着什么会被采用,再加上“出现率”这个定义本身。那项引用研究的类别标签由它自己定义,而且它明确提示自身的来源类型分类里含有噪声值,所以请把 34% 到 46% 读作一个边界偏软的区间。那段示范算术使用的是为贴近现实而挑选的虚构输入;其中的 20% 与 90% 都是示意性的,你自己的数字会不一样。

产品在哪里派得上用场,在哪里派不上

这里的整套防线都是免费的,一个下午就够:给每条 prompt 标上“可追证”或“自指”,把拿不准的那些去掉品牌名再跑一遍,把两个切片分别汇报,并把品牌桶控制在四条左右。这就是表格里的一列加一条规则,而它是本阶段里杠杆最高的一件事,因为它决定了其余每个数字有没有意义。Bavior 无法替你做这件事。它不替你写 prompt,无法知道你的买家实际使用哪些说法,而且你给它什么面板它就跑什么面板,包括一个糟糕的面板。它做的是执行:一份固定面板按计划跨五个引擎运行,记录每一个被引用的 URL,让你看清某条答案是来自你自己的域名还是别人的域名,这是事后识别自指条目最快的办法;当被引用的来源是一条活跃的讨论帖时,它会用你掌控的账号起草回复,在任何内容发出之前由你审批。免费 AI 可见性检测免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 30 日)。

出处:全部于 2026 年 8 月 30 日重新核查
  1. Google Search Central,《AI features and your website》,更新于 2025 年 12 月 10 日(页面必须已被收录且可带摘要展示;第一方文档):developers.google.com/search/docs/appearance/ai-features
  2. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(相关性与上下文位置被评为高置信度;引用分数预测点击、转化或收入被评为极低;把 C-SEO Bench 转述为约 1 900 条查询、16 360 份文档):arxiv.org/abs/2607.14035
  3. Puerto、Gubri、Green、Oh 与 Yun,《C-SEO Bench: Does Conversational SEO Work?》,NeurIPS 2025 数据集与基准赛道,arXiv:2506.11097;十种方法,“超过 1.9k 条查询与 16k 份文档”;“三个案例显著;表 3,GPT-4o-mini,零售列,最佳 SEO 为 2.77,最佳内容改写为 0.36:arxiv.org/abs/2506.11097
  4. Sielinski,《Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement》,2026 年 3 月,arXiv:2603.08924(预印本;三个平台上的幂律型引用分布与测量噪声本底):arxiv.org/abs/2603.08924
  5. 哥伦比亚大学 Tow 数字新闻中心:Jaźwińska 与 Chandrasekar,《AI Search Has a Citation Problem》,2025 年 3 月 6 日,八个引擎、一千六百条查询,超过 60% 返回错误答案:cjr.org;以及《How ChatGPT Search (Mis)represents Publisher Content》,2024 年 11 月,两百条引文,153 条回答部分或完全错误,只有七次承认不确定:cjr.org
  6. 最常被引用页面研究,2025 年 10 月:某助手在 2025 年 9 月引用最多的前 1,000 个页面;其中首页与落地页占 23.8%,被引用页面中约三分之一落在一家企业能现实参与竞争的类别中。厂商发布;按本课程的出处规则,只描述不链接。
  7. Zhang、He 与 Yao,《From Citation Selection to Citation Absorption》,2026 年 4 月,arXiv:2604.25707;602 条受控 prompt、21,143 条搜索层引用;被归为“官方”的来源在 ChatGPT 上占 34.22%,在 Google 上占 46.35%,在 Perplexity 上占 44.07%(预印本,仅描述性统计):arxiv.org/abs/2604.25707
  8. Google Search Central,《Google’s guide to optimizing for generative AI features on Google Search》,更新于 2026 年 7 月 10 日(“根植于我们核心搜索的排序与质量系统”这句话的出处;第一方文档):developers.google.com/search/docs/fundamentals/ai-optimization-guide
常见问题

你想知道的,都在这里。

到底什么样的 prompt 算“自指”?

它的措辞来自你的营销而不是买家,所以能匹配它的页面只有你自己的页面。三个标记能抓住其中绝大多数:一个你造的词、一个只有你站点在用的功能名,或一种“因为你写了它才存在”的问题表述。最快的确认方式是机械的:把这段措辞原样搜一下,看回来的是谁的页面。如果每一条结果都是你的,说明这条 prompt 没有竞争语料,而测量你在答案里的出现,只不过确认了你自己的站点已被收录。

在 prompt 面板里跟踪自己的品牌名,是不是不对?

不算错,前提是品牌类 prompt 只占一个独立的小桶、按准确性而不是按是否出现来打分,而且绝不并入头条数字。品牌类 prompt 回答的是一个真实问题:当引擎描述你时,描述是否正确?而 Tow 中心那项覆盖八个引擎、一千六百条查询、发现其中超过 60% 返回错误答案的审计,已经足以构成去核查的理由。它们无法告诉你的是:一个陌生人能不能找到你。因为在一个含有你自己名字的问题上,你几乎总是会出现在答案里。

我们的 AI 可见性分数一直在涨,怎么判断它是不是真的?

把面板拆开,分别看两个比率,这大约需要一小时,而且能把问题定死。把措辞来自买家的条目算作一个数字,把措辞来自你自身定位话术的条目算作另一个。如果前者持平或在下降,而混合后的头条数字在上涨,那么这个变化来自组配而不是可见性:一个你总是能赢的切片,在分母里的占比变大了。另外还要检查是不是有 prompt 在没有升版本号的情况下被加了进来,因为一个靠添加而增长的面板,会自己往上漂。

面板里可以用我自己的产品词汇吗?

在买家确实采用了它的地方可以用,而且要去检验采用与否,不要假设。一个由你带火、如今在通话逐字稿里出自买家之口的说法,是可追证的词汇,和其他任何买家措辞一样可以进面板。一个只出现在你的营销材料和链接到你的页面上的说法,就是还没有被采用,无论你多得意。证据就在你的逐字稿里,所以检验方式和本阶段里管着每个来源的那一条一样:指出一个说过它的真人。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

一个靠自己多写几篇就能拉高的数字,
不是测量。

免费试用