一次观测就是:一条 prompt,在一个引擎上跑一次。项目里其他所有成本都以它为单位报价。一个 40 条 prompt、每条每周跑 5 次、覆盖 5 个引擎的面板,每周产生 1,000 次采集,这才是预算表里该写的数字,而大多数计划在那一栏只写了“监测”两个字。一年下来是 52,000 次。
钱不是花在“问”上。一次采集只有带上让它能与下一次比较的记录才值得保留,而 2026 年那份批判性综述把这份记录规定为:产品、模式、模型、日期、地区、账号,以及是否开启了搜索,外加答案原文和它引用的 URL。1七个系统字段加上正文,一千次里每一次都要有。手工做的话,按每次观测十五秒算,包括粘贴、等待、记录是否被提及、复制被引用的 URL,一千次采集接近每周四小时。这个耗时是我们自己跑这套循环得出的,不是已发表的基准,也是本文里第一个你应该用自己的数据替换掉的数字。
对预算的影响是:在有人把它自动化之前,测量这条线没有规模效应。面板扩大十倍就是工时增加十倍。值得记录的字段是先把“记录什么”定下来的地方,然后再去定“记录多少次”。