因为一条异议被答错的代价,是一笔在你生意里任何地方都不产生信号的单子。没人来访,没人跳出,没人开工单:一个人问了“做你这个品类会不会被封号”,得到一个笃定而错误的答案,然后去了别处。相比之下,其余每一类 prompt 的失败都是软着陆。在“X 是什么”这类 prompt 上,出错只是表面问题,买家再读两个来源就会自己修正;而在“X 用起来安全吗”上,出错就是流程结束。
答错的概率并不低,而诚实的说法是给出一个带样本的区间。哥伦比亚大学 Tow 数字新闻中心 2025 年对八个引擎、1,600 条查询的审计发现,超过 60% 返回了错误答案,最差的引擎错误率达 94%,最好的也仍有 37%;更早的一次 200 条引文测试中,153 条回答部分或完全错误,而模型只有 7 次表达了不确定。1 在句子层面情况好一些,但仍不轻松:一项学术研究发现,生成式搜索答案中只有 51.5% 的句子被其引用完全支撑;一项 2026 年的研究把 98,020 条原子性主张中的约 11% 归类为“未被所引来源支撑”。23 分母不同、任务不同,结论一致:有引用并不等于描述准确。
这些研究测的是新闻归因与主张支撑,而不是产品描述,所以它们确立的不是“引擎多常把你的定价说错”,而是:这种失败常见到值得为它做准备。