首页/学习 GEO/十个字段
提示词研究 · 记录

你的 prompt 日志里该有哪十个字段?

你之后能算出来的每一个指标,都是采集当下写下的那些列的函数。日志结构才是实验本身;仪表盘只是它的一个视图。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

每次运行记录十个字段:prompt 编号与版本、prompt 类别、引擎、界面或模式、暴露出来的模型名、是否开启了网页搜索、时间戳、区域与国家、答案正文是否点了你的品牌名,以及被引用 URL 的完整列表(包括别人的)。什么都没发生的那些运行也要写一行,因为出现率有多可信,取决于它底下那个分母。2026 年那篇批判性综述给出的“GEO 研究最低清单”要求每次观测都记下七项配置:产品、模式、模型、日期、区域设置、账号,以及搜索状态;清单另一行要求保留分母与空结果。1

要点
  • 配置类字段在采集当下什么都不像,却是唯一能在日后告诉你“是引擎变了还是你变了”的那几列。
  • 提及和引用是两列,绝不是一列:有链接没点名是内容问题,有点名没链接是模型先验问题。
  • 失败的采集要留在日志里,用一个状态字段标住:200 次运行里丢掉 25 次超时,就会把 30.0% 的出现率变成 34.3%。
日志结构就是实验

为什么日志结构决定了你能得出什么结论?

因为任何分析都救不回一个从未被写下来的字段,而团队漏掉的永远是同样那几个。2026 年那篇领域批判性综述公布了一份“GEO 研究最低清单”,写得罕见地具体:记录产品、模式、模型、日期、区域设置、账号与搜索状态;在多个时间窗内做密集的重复运行;保留分母与空结果;把流水线各阶段分开,而不是把一次性的分数读成稳定排名。综述给出的建议是:把检索、引用和保真度分开来测。1 这里面大部分讲的是日志,不是分析。

注意第一行由什么构成。这七项都是配置而不是结果,在采集当下没有一个像“数据”,这恰恰是它们被丢掉的原因。它们的价值要几个月后才显现:当某个比率下跌十五个百分点,而唯一重要的问题是“是引擎变了还是你变了”。一份缺少这些列的日志回答不了这个问题。

日志结构也是让“面板版本”有意义的东西。提示词研究这一阶段 把面板当作一件带版本号的测量工具;日志就是把版本号盖到每一次观测上的地方,好让版本 2 的数字永远不会被悄悄拿来和版本 3 的比较。

结构

每一行里该有哪十个字段?

每次运行一行,在任何人去看答案之前就写好,带上下面这十个字段。

第三列就是少记一个字段日后要付的代价。

字段取值示例没有它会坏掉什么
1. prompt 编号与版本P-014 v2改过措辞的 prompt 会变成“顶着同一个名字的另一个问题”
2. prompt 类别异议类没有类别拆分,综合出现率就把自己的构成藏了起来
3. 引擎引擎 A合并会给 Jaccard 只有 0.11–0.18 的界面取平均7
4. 界面或模式带网页搜索的对话两行看起来一样的记录,其实是两个不同的实验
5. 模型名(若暴露)界面上显示的名称厂商换模型会被归因到你的内容改动上
6. 是否开启搜索是 / 否 / 未知基于检索的答案和来自模型先验的答案被混在一起
7. 带时区的时间戳2026-08-24 09:12 UTC批量运行不会被发现,而批量运行的样本是相关的
8. 区域与国家en-GB / 英国混了区域的面板无法和自己比较
9. 正文是否点名是 / 否根本算不出提及率
10. 全部被引用 URL完整列表,不只是你的算不出引用率,也没有“谁拥有这个答案”的地图

清单里隐含却没点名的一个字段,应当摆在这十项旁边:运行状态。记录这次采集是完成了、被限流了、超时了,还是被拒绝了,因为“根本没跑成的运行”和“跑了但没点你名的运行”在表格里是同一个空单元格,事实却完全相反。没有它,你就没有分母。

另有三个衍生列由这十项推出来,应该算出来而不是手填。提及来自第 9 项。引用来自第 10 项,方法是检查被引用 URL 中有没有你的域名。保真度两者都给不了:它是人去读“关于你的那句话”,在抽样上打分为准确、不完整、有误导或错误。三列,三种失效方式,三种不同的修复。1

分母

为什么空结果必须留在分母里?

因为出现率是一个分数,而一个悄悄丢掉“什么都没发生”的那些运行的分数,根本不是比率。显眼的那个版本,跑 200 次只留下被点名的 60 次然后报 100%,没有人会故意这么做。

真正会发生的版本,问题出在失败的采集上,而不是缺席的品牌上。假设那 200 次运行里有 25 次报错,而流水线把它们丢掉了,因为一条失败记录没有可解析的答案正文。出现率于是变成 60/175,即 34.3%,而不是 60/200 的 30.0%。这 4.3 个百分点的落差是一个数据处理决定,而且超过了一个 200 次观测的面板所携带的置信区间宽度的一半。更糟的是,失败很少是随机的:长答案更容易超时,某些区域限流更狠,某个引擎会拒绝另一个引擎会回答的问题,于是偏差带上了一个不是你选的方向。

三条规则可以一劳永逸地修好它。每一次尝试过的运行都写一行,包括失败的那些,并带上上一节说的状态字段。分母规则只定一次,并写进报告:“按完成的运行计算出现率,200 次尝试中完成 175 次”是一次完整披露,只花九个字。还有,把完成率本身当作一个质量指标来盯,因为一条从 95% 悄悄退化到 80% 完成率的流水线,会在现实世界什么都没发生的情况下推动你的头条数字。这是清单里团队最常违反的一条,也是唯一一条会同时污染下游所有指标的。1

两列

为什么“提及”和“引用”必须分成两列?

因为两者差距很大,在不同引擎上差距的方向还相反,而且各自指向不同团队的不同工作。提及是你的品牌名出现在正文里;引用是你的某个 URL 被挂上,无论正文有没有点名。把它们并成一个“我们出现了”的标记,会毁掉那个告诉你“接下来该干什么”的区分。

关于这个落差有多大,目前记录最清楚的是厂商研究,应当当作方向性证据来读。2026 年 6 月发布的一项研究,用 115 条 prompt 在四个平台、十四个国家产生了 3,981 次域名出现,报告称其中 62% 是“挂了链接但正文从未点名”的出现,且这个模式在引擎之间是反过来的:一个助手约 84% 提及对 21% 引用,另一个约 21% 提及对 87% 引用。11 样本很小,且是厂商发布;请把百分比当作未经核实的数据,把“方向反转”当作真正的发现。

这两种失效的修法不同。有链接没点名,意味着检索起作用了而识别失败了,通常是那段被引用的文字很有用,却从没说清是谁在说;内容团队把主语写出来就能修好。有点名没链接,意味着模型靠的是它已经知道的东西,而不是它刚检索到的东西,站内工作短期内推不动它;诊断方法是关掉搜索再跑一遍这条 prompt。而这两列都不说明描述是不是真的。Tow 中心对八个生成式搜索工具、一千六百条查询的审计发现超过 60% 的答案是错的;3 更早一次 Tow 对两百条引文的测试中,有 153 次得到部分或完全错误的回答,而只有七次表达了不确定;2 独立研究发现生成式答案中 51.5% 的句子被所挂引用完全支撑;4 另一项 2026 年的研究把 98,020 条原子性主张中的 11.0% 判定为“未被所引页面支撑”。5 保真度那一列就是为此存在的。

第十一列

答案原文要不要也存下来?

要,因为它决定了你的历史数据还能不能被重新分析。提及靠的是把品牌名去匹配正文,而这个匹配器在第一天一定会在边缘处出错:漏掉所有格和拼写变体,在某个和你共用一个词的竞品上误触发,也分不清推荐和警告。存了答案原文,你就能把修好的匹配器重跑一遍整段历史。没存,修正后的序列就只能从今天开始,那不叫序列。

保真度那一列依赖同一件事:没有人会在采集当下实时打分,所以正是存下来的原文,让审读者可以这个月去读上个月的运行。被引用的原始载荷也要照原样留着,因为一份在写入时就被压成裸域名的清单,之后再也说不出到底是哪一页被引用了。

有一条边界要守住:没人回头去读的答案存档,只有成本没有收益。要主动设定保留期,并把它写进报告,因为它才是“重算出来的序列最多能回溯多远”的上限。

结构的边界

哪些字段其实采不可靠?

这十项里有三项经常拿不到,正确的做法是把“缺失”记录下来,而不是去猜。最糟的是模型名:多数面向消费者的界面暴露的是营销标签而不是构建标识,而在一次会推动你数字的变更中,它可以纹丝不动。其次是搜索状态:有些界面会按每条查询决定要不要检索,并且从不告知,所以诚实的填法是一个代理指标,即答案里有没有任何引用,并标注它是代理。第三是区域设置:你请求的和引擎推断出来的可能不同,所以两者都存。

还有一整类东西,是答案侧日志根本看不见的。一个引擎“查阅”了某个来源却没有引用它,就不会在你的日志里留下任何痕迹,而这个区分并不学究:发表于 Findings of ACL 2026 的那项 4,706 条查询审计测的是 AI Overviews 查阅过的域名,基于 2025 年 9 月采集的数据报告其中 53% 不在自然结果前十;而 2026 年 3 月 13 日至 4 月 21 日采集的 55,393 条查询研究测的是被引述的域名,报告其中 29.8% 不出现在对应首页上。85 动词不同、分母不同、日期不同,落差之大足以让“把任一个当点值引用”成为错误。而你的日志永远只看得到“被引用”的那一半。

与之互补的是你的服务器日志:它记录的是抓取而不是答案,因而能抓到你的面板看不见的检索失败。那属于衡量 AI 可见度这一阶段,连同“这些指标哪些站得住”;面板规模见姊妹篇

本文的诚实边界

这套结构是从一篇综述的清单加上运营经验拼出来的约定,不是标准。没有人验证过这十个字段是充分的,也没有人验证过其中任何一个是必要的;也不存在一种共享格式,能让两个团队直接比较各自的日志。最弱的是保真度那一列:目前没有任何公开研究报告过“两个读者给同一条答案打分有多一致”,所以请把保真度当作内部的警戒线,而不是拿去公布的数字。

产品在哪里派得上用场,在哪里派不上

一张带上这些列的表格就是一套完整的实现,哪怕你日后会买工具,也值得先自己搭一张:思考都在这套结构里,采集只是体力活。工具真正改变的是:在一周一千次运行的规模下,那些无聊的列到底有没有被填上。状态、时间戳、区域和完整的被引用 URL 列表,正是一个赶时间的人会停止记录的字段,也正是让分母站得住脚的那些。Bavior 按计划把一组固定的 prompt 打到五个引擎上,并记录每条答案引用了哪些来源,把空结果留在记录里。它无法暴露一个引擎本身不公布的模型标识,无法告诉你关于你产品的那句话是不是真的,也不会替你决定分母规则。免费 AI 可见性检测免费 GEO 体检不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 29 日)。

出处,全部核查于 2026 年 8 月 29 日
  1. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035;表 6“GEO 研究最低清单”与 §7.5:arxiv.org/abs/2607.14035
  2. 哥伦比亚大学 Tow 数字新闻中心,《How ChatGPT Search (Mis)represents Publisher Content》,2024 年 11 月;两百条引文,153 次错误回答,仅七次表达不确定:cjr.org
  3. Jaźwińska 与 Chandrasekar,《AI Search Has a Citation Problem》,Tow 中心,2025 年 3 月 6 日;一千六百条查询、八个生成式搜索工具;原文为“incorrect answers to more than 60 percent of queries”:cjr.org
  4. Liu 等,2023;生成式搜索答案中 51.5% 的句子被其所挂引用完全支撑(见出处 1 的综述转述)
  5. Xu、Iqbal 与 Montgomery,2026;55,393 条趋势查询,2026 年 3 月 13 日至 4 月 21 日;98,020 条原子性主张中 11.0% 未被所引页面支撑;原文为“29.8% of AIO-cited domains do not appear in those first-page results”(预印本):arxiv.org/abs/2605.14021
  6. Vykopal 等,2026;依助手与话题不同,可信来源占比为 71.4–86.3%(见出处 1 的综述转述)
  7. Grossman 等,SIGIR 2026;11,500 条查询;原文为“Jaccard similarities between 0.11 and 0.18”,比较对象为 Google 自然结果、AI Overviews 与 Gemini:arxiv.org/abs/2604.27790
  8. Kirsten 等,Findings of ACL 2026;4,706 条查询审计,数据采集于 2025 年 9 月;原文为“on average 53% (27%) of domains that AIO consults are not contained in top-10 (top-100) Organic search results”:aclanthology.org/2026.findings-acl.526
  9. Sielinski,《Quantifying Uncertainty in AI Visibility》,2026 年 3 月(预印本):arxiv.org/abs/2603.08924
  10. Google Search Central,《AI features and your website》,更新于 2025 年 12 月 10 日(界面、准入条件;第一方文档):developers.google.com/search/docs/appearance/ai-features
  11. 某厂商研究,2026 年 6 月发布:115 条 prompt、3,981 次域名出现、四个平台、十四个国家;其中 62% 是“挂了链接但正文从未点名”的出现,且提及与引用之比在不同助手之间反转。厂商发布;按本课程的出处规则,只转述不外链。
常见问题

你想知道的,都在这里。

我没出现的那些运行,真的也要记录吗?

要,而且它们是日志里更重要的那一半。出现率是一个分数,其分母是你尝试过的每一次运行,所以“没出现”本身就是数据,删掉它就是把指标弄坏。真正会咬到团队的失误比“删掉没出现的记录”更隐蔽:是把报错的那些运行丢掉。如果 200 次采集里有 25 次超时而流水线把它们扔了,30.0% 的出现率会变成 34.3%,而现实世界什么都没发生,这个偏移比该面板置信区间的一半还大。

“提及”和“引用”有什么区别?

提及是你的品牌名出现在答案正文里;引用是你的某个 URL 被挂在旁边,无论正文有没有点名。两者差距很大,含义也不同。有链接但没点名,说明检索起作用了而识别失败了,通常是因为被引用的段落有用却没说清楚“这是谁在说”,这是一个内容层面的修复。有点名但没链接,说明模型靠的是它本来就知道的东西,而不是它刚检索到的东西,站内工作很难在短期内推动它。请按引擎分别汇报两者。

竞品被引用的 URL 也要记录吗?

把答案里每一个被引用的 URL 都记下来,不只是你自己的,因为这份清单是面板产出的最有行动价值的东西。你自己的出现情况只告诉你“你在不在答案里”;完整清单告诉你“谁在里面”,这把一个可见性数字变成了一张地图,标出真正拥有你所在品类那些问题的页面。在商业类问题上,这份清单里很大一部分会是第三方文章和社区帖子,而不是任何厂商自己的页面,而这正是决定“修复动作归内容团队还是归站外工作”的那个发现。

引擎不告诉我是哪个模型回答的,那该记什么?

记下界面上显示的内容,并标明它是一个标签而不是构建标识;把它的任何变化当作一个假设,而不是一个事实。多数面向消费者的界面暴露的是一个营销名称,而底层变化时这个名称可以保持不变,所以这个字段在两个方向上都是弱证据:标签没变不能证明没变,标签变了也不能证明变化导致了你观察到的结果。仍然记录它的价值在于:当某个比率的跳变超过你的置信区间时,你有一个可以先去核对的对象。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

十个字段,每次都填满。
其余一切只是它们的一个视图。

免费试用