因為一條異議被答錯的代價,是一筆在你生意裡任何地方都不產生信號的單子。沒人來訪,沒人跳出,沒人開工單:一個人問了你這個品類會不會讓帳號被封,得到一個篤定而錯誤的答案,然後去了別處。相比之下,其餘每一類 prompt 的失敗都是軟著陸。在「X 是什麼」這類 prompt 上,出錯只是表面問題,買家再多讀兩個來源就會自己修正;而在「X 用起來安全嗎」上,出錯就是流程結束。
答錯的機率並不低,而誠實的說法是給出一個帶樣本的區間。哥倫比亞大學 Tow 數位新聞中心 2025 年對八個引擎、1,600 條查詢做的審計發現,超過 60% 返回了錯誤答案,最差的引擎錯誤率達 94%,最好的也仍有 37%;更早的一次 200 條引文測試中,153 條回答部分或完全錯誤,而表達不確定的只有 7 次。1 在句子層面情況好一些,但仍不輕鬆:一項學術研究發現,生成式搜尋答案中只有 51.5% 的句子被其引用完全支撐;一項 2026 年的研究把 98,020 條原子主張中的約 11% 歸類為未被所引來源支撐。23 分母不同、任務不同,結論一致:有引用並不等於描述準確。
這些研究測的是新聞歸因與主張支撐,而不是產品描述,所以它們確立的不是引擎多常把你的定價說錯,而是:這種失敗模式常見到值得為它做準備。