這四個數字量的不是同一件事,而它們之間的落差是資訊,不是矛盾。Tow 中心的兩項研究測的是歸因:給定一段文字,引擎能不能點對出版方、連對文章。句子級與主張級的研究測的是蘊涵:掛在這句話上的來源,是否真的支撐它。歸因在多數情況下失敗,蘊涵在相當可觀的一部分上失敗,這與機制吻合,因為模型先根據讀到的材料流暢地寫,然後才把來源掛上去。
AI 引用準確度:被引用,不等於被準確描述。
這個題目上的獨立研究異常清晰,也異常糟糕。它會改變你該怎麼寫,因為引擎從你頁面裡摘走的那句話,讀者讀到時不會帶著讓它成立的那一段。
本頁內容
被引用,不等於被準確描述;而每一項針對這道落差的獨立測量,都發現它很大。請把一次引用當成「某個引擎判定你的頁面相關」的證據,絕不要當成「你連結旁邊那句話是真的」的證據。哥倫比亞大學 Tow 數位新聞中心在 2024 年 11 月,把 20 家出版機構的 200 條引文交給 ChatGPT Search,得到 153 次部分或完全錯誤的回答,而系統只有 7 次承認自己答不上來。1
關鍵要點AI 答案誤述其引用來源的頻率有多高?
頻繁到「被引用」不能當作「被準確描述」的證據:在 Tow 中心 2025 年 3 月的測試裡,八個引擎上超過 60% 的回答是錯的。
四項獨立測量,三種不同方法,全部指向同一個方向。沒有一項是廠商研究。
Tow 中心,2024 年 11 月
從 20 家出版機構取 200 條直接引文,逐條交給 ChatGPT Search 並要求它指認來源。其中 153 條回答部分或完全錯誤,而系統只有 7 次承認自己答不上來。1
Tow 中心,2025 年 3 月
用 20 家出版機構、每家 10 篇文章、跨 8 個引擎,建出 1,600 條查詢。超過 60% 回傳了錯誤答案。表現最好的那個仍有 37% 是錯的;表現最差的那個 94% 的情況下是錯的,而在給它的 200 條 prompt 中,有 154 條引用指向錯誤頁面。2
原子主張,2026 年
一項為期 40 天、涵蓋 55,393 條熱門查詢的研究,把 Google AI Overview 的回答拆解成 98,020 條原子主張,發現其中 11.0% 不被旁邊所引的頁面支撐。4
這些錯誤實際長什麼樣?
獨立研究裡出現了四種不同的失敗模式,它們需要你做出不同的應對。第一種是自信的錯誤歸因:答案點名了一個並沒有說過那句話的來源。Tow 中心 2024 年 11 月的測試發現,ChatGPT Search 在 200 次嘗試裡只含糊其辭了 7 次,所以錯誤答案是用與正確答案完全相同的語氣送到你面前的。1
第二種是斷掉的引用。2025 年 3 月的研究給 Grok 3 的 200 條 prompt 中,有 154 條引用指向錯誤頁面:看起來像證據、點進去卻什麼都沒有的連結。2 第三種是部分支撐:結論大致正確,來源真實存在,而句子裡那個具體的數字或限定條件並不在來源裡。這一種對品牌傷害最大,因為讀者看不出來,而且它會產出一個聽起來合理、關於你自家定價、限額或能力、但你從未說過的主張。
第四種是複合體。當引擎抓不到原始來源時,它會用其他討論該來源的東西拼出一個答案。Tow 中心在 2025 年 10 月觀察到的正是這一幕:出版方封鎖了爬蟲,於是該 Agent 用關於該文章的推文、轉載版本、其他媒體的引述與相關報導,拼出了一份複合摘要。5 那份輸出看起來像是對你的描述。它其實是對「別人怎麼說你」的描述。
可信度與支撐是分開量的,兩邊的結果都參差不齊。一項經同儕審查的 EACL 2026 聊天助手研究觀察到,可信來源佔比在 71.4% 到 86.3% 之間,取決於助手與話題;在某些 GPT 配置下出現的錯誤資訊來源,比 Perplexity 或 Qwen 更多。8 反過來讀,一條答案背後大約有 14% 到 29% 的來源,落在該研究的可信集合之外。
這個池子也越來越難讀。一項審計涵蓋 ChatGPT、Copilot、Gemini 與 Perplexity 上關於政治、健康與環境的 712 個真實問題,在四個引擎上都發現了 AI 生成來源被引用的證據,約占被引來源的 16%。9 這會改變你要瞄準的目標。你要爭的不是在一座已經審查過的資料庫裡被提到最多次;你要爭的是在一個已經混進描述你所屬品類的合成頁面的池子裡,成為某個事實最清楚、最正確的第一方陳述。
簽授權協議或封鎖爬蟲能保護你嗎?
在這個問題唯一的獨立測試裡,兩者都沒有用。Tow 中心 2025 年 3 月的研究指出:在它當年 2 月所做的測試中,授權協議並沒有帶來準確性上的好處;而封鎖了爬蟲的出版方照樣被引用:Perplexity 的免費版把 10 條來自 National Geographic 付費牆文章的摘錄全部指認正確,儘管該出版方禁止 Perplexity 的爬蟲,也與這家公司沒有任何正式關係。2 合約買不到保真度,robots.txt 規則也買不到「不出現」。
2025 年 10 月的後續研究,說明了封鎖為什麼會特別適得其反。代理型瀏覽器,也就是代替使用者驅動真實瀏覽器的 Chromium 工作階段,取回了一篇 9,000 詞的僅限訂閱者文章的全文,而 ChatGPT 與 Perplexity 的標準介面拒絕了同一請求,因為該出版方封鎖了這兩家公司的爬蟲。5 封鎖改變的是由哪些來源來描述你;它不會把你從答案裡移走,而且通常讓描述變得更糟。
站得住腳的姿態與築牆恰恰相反:做那個最容易被抓取、也最容易被引用的正確來源,並把引擎會被問到的那些事實,以帶日期的伺服器端渲染文字,放在你自己的網域上。
本文所有強力的準確性證據,都來自 2024 年 11 月至 2025 年 3 月之間建立的新聞出版測試集,而新聞歸因比描述一個 SaaS 產品的定價頁更難。目前沒有任何獨立研究測量過 AI 答案誤述一家公司自身產品事實的頻率,所以上面那些錯誤率應該讀作「誤述很常見、也不可預測」的證據,而不是適用於你品牌的一個比率。後面的寫作建議同樣只是相關性的:它來自被抽取的段落長什麼樣,而不是來自某項證明「這樣寫會導致被正確引用」的對照實驗。
怎麼寫一句被單獨引用也依然成立的話?
把主語、限定條件與日期直接寫進句子本身,讓這句話在整頁被移除之後依然成立。一份為期一年、涵蓋 1,570 萬條 AI Mode 引用的資料集,解析出 460 萬條被高亮的段落,中位長度 117 詞,其中約 85% 完全自足,80% 在第一句就給出答案。6
扛得住被抽取
- 「截至 2026 年 8 月 29 日,Bavior 的入門方案為每月 $99 按月計費。」主語、數字、計費方式與日期全在一句話裡。
- 「查詢扇出是把一個問題展開成跨子話題的多次搜尋,Google 已針對 AI Overviews 與 AI Mode 記錄過這個做法。」一個平鋪直敘的定義,附帶它的歸因。
- 「在發表於 Findings of ACL 2026 的一項 4,706 條查詢審計中,Google AI Overviews 查閱過的網域有 53% 不在自然結果前 10 名。」樣本、發表場合、數字與範圍都在一行裡。
會被引錯
- 「這表示它要 $99。」指涉對象、計費週期與日期全在上一段,而上一段不會跟著它走。
- 「如上所述,大多數引用來自前 10 名之外。」結構上就不可引用:沒有主語、沒有出處、沒有範圍。
- 「研究顯示有 40% 的提升。」沒有點名研究、沒有指標、沒有條件;而且該領域 2026 年的綜述把這個數字歸檔為不可作一般用途,說它只是單一配置下、單一指標上的一個相對最大值。7
這條規則可以推廣成一個五秒鐘就能用在任何句子上的測試:把頁面上其他每一句都刪掉,再讀一次這句。如果它依然成立、依然可歸因、依然講的是那個主語,它就扛得住被抽取。如果它需要上面那一段,那麼遲早會有引擎在不帶那一段的情況下引用它,而由此產生的主張,是你沒有說過、卻會被認為你說過的。
這條建議要配兩個告誡。第一,寫得像可被引用,不等於寫得真實:2026 年的批判性綜述指出,加入一個捏造的統計數字可能提高被複用的機會,同時降低認識論品質;標準是相關、可驗證、有日期且正確歸因的證據,而不是句子裡有沒有數字。7 第二,這一切都救不了一個從未被檢索到的頁面。
當引擎把你描述錯了,你能做什麼?
能做的比你希望的少,而且有用的動作都是間接的。主流引擎沒有更正端點,沒有為關於你產品的一句錯話設立的工單佇列,也沒有公布過處理時限。你能做的是改變答案賴以拼裝的材料,然後等待重新抓取。
落到實處是四個動作。把有爭議的事實以純伺服器端渲染的文字放到你自己的網域上,寫成一句自帶主語與日期的話。確認寫錯的那個引擎確實抓得到那個頁面,要查搜尋令牌,而不是訓練令牌;每一家廠商都把兩者分開寫在文件裡。去看那條錯誤答案實際引用了什麼:如果錯誤來自第三方頁面或一串陳舊的討論串,修復點就在那裡,不在你的網站上。以及,把這個錯誤連同日期、引擎與 prompt 一起記錄下來,因為單獨一條錯誤答案只是從一個分布裡抽的一次樣,你需要它重複出現,才能判斷它是不是系統性的。
要誠實設定預期。這個過程緩慢、局部、且沒有保證;同一批證據既顯示誤述很常見,也顯示合約和封鎖都沒能修好它。現實的目標是讓正確的那個版本成為最容易被引用的版本,而這正是AI 搜尋如何運作這個階段在管線其餘環節上一貫建議的工作。
上面這一切都可以徒手完成:寫自足的句子、把事實放在伺服器端渲染的文字裡、把錯誤答案記進一張表格。Bavior 只幫得上記錄那一半。它按排程把一組固定的 prompt 跑遍五個引擎,並記錄每一條答案引用了哪些來源,你據此才知道某個錯誤描述是重複出現,還是一次性的。它無法更正引擎,無法讓一條糟糕的答案被撤回,也不判斷答案正文在事實上對不對,沒有任何產品做得到。免費 AI 能見度檢測與免費 GEO 健檢不需要付費方案;付費追蹤為按月付費每月 $99 起,或按年付費每月 $79.17(截至 2026 年 8 月 29 日)。
- 哥倫比亞大學 Tow 數位新聞中心,《How ChatGPT Search (Mis)represents Publisher Content》,2024 年 11 月 27 日;200 條引文、20 家出版機構;ChatGPT「returned partially or entirely incorrect responses on a hundred and fifty-three occasions, though it only acknowledged an inability to accurately respond to a query seven times」 · cjr.org
- Jaźwińska 與 Chandrasekar,Tow 中心,《AI Search Has a Citation Problem》,2025 年 3 月 6 日;1,600 條查詢、20 家出版機構、8 個引擎;超過 60% 錯誤;「Out of the 200 prompts we tested for Grok 3, 154 citations led to error pages」 · cjr.org
- Liu、Zhang 與 Liang,《Evaluating Verifiability in Generative Search Engines》,2023;「on average, a mere 51.5% of generated sentences are fully supported by citations」 · arxiv.org/abs/2304.09848
- Xu、Iqbal 與 Montgomery,《Measuring Google AI Overviews》,2026 年 5 月 13 日(預印本);55,393 條熱門查詢、為期 40 天;「decomposing responses into 98,020 atomic claims, 11.0% are unsupported by the cited pages」 · arxiv.org/abs/2605.14021
- Chandrasekar 與 Jaźwińska,Tow 中心 / CJR,《How AI browsers sneak past blockers and paywalls》,2025 年 10 月 30 日 · cjr.org
- 為期一年、涵蓋 148 個行業的 15,699,298 條 AI Mode 引用資料集,解析出 270 萬個頁面上的 460 萬條被高亮段落,2026 年 7 月;段落中位長度 117 詞,約 85% 自足,80% 在第一句給出答案。廠商發布;依本課程的出處規則,只描述、不連結。
- 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(綜述預印本);第 8.3 節的標題為「Citation Implies Neither Credibility nor Support」,其置信度表把 40% 的能見度數字否決為一般性主張,稱它是「a relative maximum on one metric under a specific configuration」 · arxiv.org/abs/2607.14035
- Vykopal、Pikuliak、Ostermann 與 Šimko,《Assessing Web Search Credibility and Response Groundedness in Chat Assistants》,EACL 2026,第 2539–2560 頁;可信來源佔比 71.4–86.3%,取決於助手與話題 · aclanthology.org/2026.eacl-long.115
- Allaham 與 Diakopoulos,《Synthetic Sources? Auditing Generative Search Engine Citations for Evidence of AI-Generated Sources》,2026 年 5 月 22 日(預印本);4 個引擎、712 條查詢;「evidence of AI-generated sources being cited across all four generative search engines (~16% of cited sources)」 · arxiv.org/abs/2605.23684
你想知道的,都在這裡。
如果 AI 引擎引用了我的頁面,答案就把我的頁面描述對了嗎?
不可靠。Tow 中心在 2024 年 11 月用 20 家出版機構的 200 條引文測試 ChatGPT Search,發現 153 條回答部分或完全錯誤,而系統只有 7 次承認自己答不上來;2025 年 3 月涵蓋 1,600 條查詢、八個引擎的後續研究發現,超過 60% 回傳了錯誤答案。另外,生成式搜尋答案裡只有 51.5% 的句子被掛在它們身上的引用完全支撐。請把一次引用當作相關性的證據,絕不要當作被準確描述的證據。
封鎖 AI 爬蟲能阻止引擎把我的產品寫錯嗎?
不能,而且通常讓描述更糟。Tow 中心 2025 年 3 月的研究發現,封鎖了爬蟲的出版機構依然被引用,而授權協議同樣沒有帶來準確性上的好處。它 2025 年 10 月的後續研究展示了封鎖真的守住時會發生什麼:引擎改用推文、轉載版本與第三方報導拼出一個複合答案。封鎖改變的是由哪些來源來描述你,而不是你會不會被描述;何況代理型瀏覽器就是普通的 Chromium 工作階段,robots.txt 規則構不到它們。
我該怎麼寫,AI 答案才會引用得準確?
你希望被引用的每一句話,都要寫成整頁被刪掉之後依然成立。把主語、限定條件與日期放進句子內部:寫「截至 2026 年 8 月 29 日,我們的入門方案為每月 $99 按月計費」,而不是「這表示它要 $99」。一份為期一年、涵蓋 1,570 萬條 AI Mode 引用的資料集,解析出 460 萬條被高亮的段落,中位長度 117 詞,其中約 85% 完全自足,80% 在第一句就給出答案。這個模式屬於相關性證據,但它要防的那種失敗並不是假想的。
被引用是不是代表引擎挑到了可信來源?
不是。一項經同儕審查的 EACL 2026 聊天助手研究測到的可信來源佔比在 71.4% 到 86.3% 之間,取決於助手與話題,也就是說一條答案背後大約有 14% 到 29% 的來源落在它的可信集合之外。另一項 2026 年的審計涵蓋 ChatGPT、Copilot、Gemini 與 Perplexity 上的 712 個真實問題,在四個引擎上都發現了 AI 生成來源被引用的證據,約占被引來源的 16%。可信度和確實支撐是兩種不同的性質,而一次引用兩者都不保證。
我能讓 AI 引擎更正一條關於我公司的錯誤答案嗎?
主流引擎都沒有更正端點,所以實際路徑是間接而緩慢的。把有爭議的事實以純伺服器端渲染的文字放到你自己的網域上,寫成一句自足且帶日期的話;確認寫錯的那個引擎真的抓得到那個頁面,要查它的搜尋爬蟲令牌,而不是訓練令牌;去看那條錯誤答案引用了什麼,因為錯誤常常長在第三方頁面而不是你的站上;並把錯誤連同引擎、prompt 與日期一起記錄下來,這樣你才能把系統性問題和一次運氣不好的抽樣分開。
哪一個 AI 引擎在引用來源上最準確?
被測的八個引擎表現都很差,而且這個排名已經舊到不該拿來做決策。在 Tow 中心 2025 年 3 月那項 1,600 條查詢的研究裡,表現最好的那個仍有 37% 回傳錯誤答案;ChatGPT 錯誤指認了 134 篇文章,而在 200 條回答裡只有 15 次表現出信心不足;表現最差的那個 94% 的情況下是錯的,它在 200 條 prompt 上的引用裡有 154 條指向錯誤頁面。引擎行為在幾個月內就會變,所以請把這個結論當作「到處都常見誤述」,而不是一張排行榜。
負責研究與維護 Bavior 關於 Reddit 行銷和 AI 搜尋可見度的所有內容。文中每一個數字都註明了來源出處與查證日期,所有外部連結均非聯盟推廣連結。
發現數字有誤?告訴我們,我們會重新查證:support@bavior.com