这四个数字测的不是同一件事,而它们之间的落差是信息,不是矛盾。Tow 中心的两项研究测的是“归因”:给定一段文字,引擎能否点对出版方、链对文章。句子级和主张级的研究测的是“蕴含”:挂在这句话上的来源是否真的支撑它。归因在多数情况下失败,蕴含在相当大的一部分上失败,这与机制吻合,因为模型先根据读到的材料流畅地写,然后才把来源挂上去。
AI 引用准确度:被引用,不等于被准确描述。
这个问题上的独立研究异常清晰,也异常糟糕。它会改变你该怎么写,因为引擎从你页面里摘走的那句话,读者读到时不会带上让它成立的那一段。
本页内容
被引用,不等于被准确描述;而每一项针对这个落差的独立测量,都发现它很大。请把一次引用当作“某个引擎认为你的页面相关”的证据,绝不要当作“你链接旁边那句话是真的”的证据。哥伦比亚大学 Tow 数字新闻中心在 2024 年 11 月把 20 家出版机构的 200 条引文交给 ChatGPT Search,得到了 153 次部分或完全错误的回答,而系统只有 7 次承认自己答不上来。1
关键要点AI 答案误述其引用来源的频率有多高?
频繁到“被引用”并不能作为“被准确描述”的证据:在 Tow 中心 2025 年 3 月的测试里,八个引擎上超过 60% 的回答是错的。
四项独立测量,三种不同方法,全部指向同一个方向。没有一项是厂商研究。
Tow 中心,2024 年 11 月
从 20 家出版机构取 200 条直接引文,逐条交给 ChatGPT Search 并要求它指认来源。其中 153 条回答部分或完全错误,而系统只有 7 次承认自己答不上来。1
Tow 中心,2025 年 3 月
用 20 家出版机构、每家 10 篇文章、跨 8 个引擎构造出 1,600 条查询。超过 60% 返回了错误答案。表现最好的那个仍有 37% 是错的;表现最差的那个 94% 的情况下是错的,而在给它的 200 条 prompt 中,有 154 条引用指向错误页面。2
原子性主张,2026 年
一项为期 40 天、覆盖 55,393 条热门查询的研究,把 Google AI Overview 的回答拆解成 98,020 条原子性主张,发现其中 11.0% 不被其旁边所引的页面支撑。4
这些错误具体长什么样?
独立研究中出现了四种不同的失效方式,它们需要你作出不同的应对。第一种是自信的错误归因:答案点名了一个并没有说过那句话的来源。Tow 中心 2024 年 11 月的测试发现,ChatGPT Search 在 200 次尝试里只含糊其辞了 7 次,也就是说,错误答案和正确答案是用同样的语气送到你面前的。1
第二种是断掉的引用。2025 年 3 月的研究给 Grok 3 的 200 条 prompt 中,有 154 条引用指向错误页面:看起来像证据、点进去却什么都没有的链接。2 第三种是部分支撑:结论大致没错,来源真实存在,而句子里那个具体的数字或限定条件并不在来源里。这一种对品牌伤害最大,因为读者看不出来,而它会产出一个听起来合理、关于你自家定价、限额或能力、但你从未说过的主张。
第四种是“复合体”。当引擎抓不到原始来源时,它会用其他讨论该来源的东西拼出一个答案。Tow 中心在 2025 年 10 月观察到的正是这一幕:出版方屏蔽了爬虫,于是智能体用关于该文章的推文、转载版本、其他媒体的引述和相关报道,拼出了一份复合摘要。5 那份输出看起来像是对你的描述,其实是对“别人怎么说你”的描述。
可信度和支撑是分开测量的,而两者的结果都参差不齐。一项经同行评议的 EACL 2026 研究测量了聊天助手的“可信来源占比”,结果在 71.4% 到 86.3% 之间,取决于助手和话题;在某些 GPT 配置下出现的错误信息来源,比 Perplexity 或 Qwen 更多。8 反过来读,一条答案背后约有 14% 到 29% 的来源落在该研究的可信集合之外。
这个来源池也越来越难读。一项审计覆盖 ChatGPT、Copilot、Gemini 和 Perplexity 上关于政治、健康与环境的 712 个真实问题,在四个引擎上都发现了 AI 生成来源被引用的证据,约占被引来源的 16%。9 这会改变你要瞄准的目标。你要争的不是“在一个已被审核过的资料库里被提到最多次”,而是在一个已经混进了描述你所在品类的合成页面的池子里,成为某个事实最清晰、最正确的第一方陈述。
签授权协议或屏蔽爬虫能保护你吗?
在该问题唯一的独立测试里,两者都没起作用。Tow 中心 2025 年 3 月的研究报告称:在它当年 2 月所做的测试中,授权协议并没有带来准确性上的好处;而屏蔽了爬虫的出版方照样被引用:Perplexity 的免费版把我们提供的 10 条来自 National Geographic 付费墙文章的摘录全部指认正确,尽管该出版方禁止了 Perplexity 的爬虫,也与这家公司没有任何正式关系。2 合同买不到保真度,robots.txt 规则也买不到“不出现”。
2025 年 10 月的后续研究说明了屏蔽为什么会适得其反。智能体浏览器(代表用户驱动真实浏览器会话的 Chromium 构建)取回了一篇 9,000 词的仅限订阅者文章的全文,而 ChatGPT 与 Perplexity 的标准界面拒绝了同一请求,因为该出版方屏蔽了这两家公司的爬虫。5 屏蔽改变的是“由哪些来源来描述你”,它不会把你从答案里移走,而且通常让描述变得更糟。
站得住脚的姿态与“筑墙”恰恰相反:做那个最容易被抓取、也最容易被正确引用的来源,把引擎会被问到的那些事实以带日期的服务端渲染文字放在你自己的域名上。
本文所有强力的准确性证据,都来自 2024 年 11 月至 2025 年 3 月之间构建的新闻出版测试集,而新闻归因比“描述一个 SaaS 产品的定价页”是更难的任务。目前没有任何独立研究测量过 AI 答案误述一家公司自身产品事实的频率,所以上面的错误率应被读作“误述常见且不可预测”的证据,而不是适用于你品牌的一个比率。后文的写作建议同样是相关性的:它来自“被抽取的段落长什么样”,而不是来自某项证明“这样写会导致被正确引用”的受控实验。
怎么写一句“被单独摘走也依然成立”的话?
把主语、限定条件和日期直接写进句子内部,让这句话在整页被删掉之后依然成立。一份为期一年、覆盖 1,570 万条 AI Mode 引用的数据集,解析出 460 万条被高亮的段落,中位长度 117 词,其中约 85% 完全自足,80% 在第一句就给出答案。6
扛得住被抽取
- 「截至 2026 年 8 月 29 日,Bavior 的入门方案为每月 99 美元按月计费。」主语、数字、计费方式和日期全在一句里。
- 「查询扇出是指把一个问题展开成跨子话题的多次搜索,Google 已就 AI Overviews 与 AI Mode 记录了这一做法。」一个平铺直叙的定义,附带它的归因。
- 「在发表于 Findings of ACL 2026 的一项 4,706 条查询审计中,Google AI Overviews 查阅过的域名有 53% 不在自然结果前十。」样本、发表场合、数字和范围都在一行里。
会被引错
- 「这意味着它要 99 美元。」指代对象、计费周期和日期全在上一段,而上一段不会跟着它走。
- 「如上所述,大多数引用来自前十之外。」结构上就不可引用:没有主语、没有出处、没有范围。
- 「研究表明提升了 40%。」没有点名研究、没有指标、没有条件;而且该领域 2026 年的综述已把这个数字列为“不可作一般性主张”,称它只是特定配置下单一指标上的一个相对最大值。7
这条规则可以概括成一个五秒内就能用在任何句子上的测试:把页面上其他每一句都删掉,再读一遍这句。如果它依然成立、依然可归因、依然说的是那个主语,它就扛得住被抽取。如果它需要上面那一段,那么迟早会有引擎在不带上面那一段的情况下引用它,而由此产生的那个主张,是你没说过、但会被认为你说过的。
这条建议要配两个告诫。第一,“写得像可被引用”不等于“写得真实”:2026 年的批判性综述明确写道,加入一个捏造的统计数字可能提高被复用率,同时降低认识论质量;标准是相关的、可验证的、有日期的、正确归因的证据,而不是“有没有数字”。7 第二,这一切都救不了一个从未被检索到的页面。
当引擎把你描述错了,你能做什么?
能做的比你希望的少,而且有用的动作都是间接的。主流引擎没有更正入口,没有为“关于你产品的一句错话”设立的工单队列,也没有公布过处理时限。你能做的是改变答案赖以拼装的材料,然后等待重新抓取。
落到实处是四个动作。把有争议的事实以纯服务端渲染的文字放到你自己的域名上,写成一句自带主语和日期的话。确认写错的那个引擎确实抓得到那个页面,要查它的搜索令牌,而不是训练令牌;每家厂商都把两者分开写在文档里。去看那条错误答案实际引用了什么:如果错误来自第三方页面或一条陈旧的讨论帖,修复点就在那里,不在你的站上。以及,把这个错误连同日期、引擎和 prompt 一起记录下来,因为单独一条错误答案只是从一个分布里抽的一次样,你需要重复出现才能判断它是不是系统性的。
要如实设定预期。这个过程缓慢、局部、且没有保证;同一批证据既显示误述很常见,也显示合同和屏蔽都没能修好它。现实的目标是:让正确的那个版本成为最容易被引用的版本,这和AI 搜索如何工作这一阶段对管线其余环节的建议,是同一件工作。
上面这一切都可以徒手完成:写自足的句子、把事实放在服务端渲染的文字里、把错误答案记进一张表格。Bavior 只帮上“记录”那一半:它按计划把一组固定的 prompt 跑遍五个引擎,并记录每条答案引用了哪些来源,你据此才能知道某个错误描述是重复出现还是一次性的。它无法更正引擎,无法让一条糟糕的答案被撤回,也不判断答案正文在事实上对不对,没有任何产品能做到。免费 AI 可见性检测和免费 GEO 体检不需要付费方案;付费追踪为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 29 日)。
- 哥伦比亚大学 Tow 数字新闻中心,《How ChatGPT Search (Mis)represents Publisher Content》,2024 年 11 月 27 日;200 条引文、20 家出版机构;原文为“ChatGPT returned partially or entirely incorrect responses on a hundred and fifty-three occasions, though it only acknowledged an inability to accurately respond to a query seven times” · cjr.org
- Jaźwińska 与 Chandrasekar,Tow 中心,《AI Search Has a Citation Problem》,2025 年 3 月 6 日;1,600 条查询、20 家出版机构、8 个引擎;超过 60% 错误;原文为“Out of the 200 prompts we tested for Grok 3, 154 citations led to error pages” · cjr.org
- Liu、Zhang 与 Liang,《Evaluating Verifiability in Generative Search Engines》,2023;原文为“on average, a mere 51.5% of generated sentences are fully supported by citations” · arxiv.org/abs/2304.09848
- Xu、Iqbal 与 Montgomery,《Measuring Google AI Overviews》,2026 年 5 月 13 日(预印本);55,393 条热门查询、为期 40 天;原文为“decomposing responses into 98,020 atomic claims, 11.0% are unsupported by the cited pages” · arxiv.org/abs/2605.14021
- Chandrasekar 与 Jaźwińska,Tow 中心 / CJR,《How AI browsers sneak past blockers and paywalls》,2025 年 10 月 30 日 · cjr.org
- 为期一年、覆盖 148 个行业的 15,699,298 条 AI Mode 引用数据集,解析出 270 万个页面上的 460 万条高亮段落,2026 年 7 月;段落中位长度 117 词,约 85% 完全自足,80% 在第一句给出答案。厂商发布;按本课程的出处规则,只描述、不链接。
- 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(综述预印本);第 8.3 节标题为“Citation Implies Neither Credibility nor Support”,其置信度表否定了把“GEO increases visibility by 40%”作为一般性主张,称它是“a relative maximum on one metric under a specific configuration” · arxiv.org/abs/2607.14035
- Vykopal、Pikuliak、Ostermann 与 Šimko,《Assessing Web Search Credibility and Response Groundedness in Chat Assistants》,EACL 2026,第 2539–2560 页;可信来源占比 71.4–86.3%,取决于助手与话题 · aclanthology.org/2026.eacl-long.115
- Allaham 与 Diakopoulos,《Synthetic Sources? Auditing Generative Search Engine Citations for Evidence of AI-Generated Sources》,2026 年 5 月 22 日(预印本);4 个引擎、712 条查询;原文为“evidence of AI-generated sources being cited across all four generative search engines (~16% of cited sources)” · arxiv.org/abs/2605.23684
你想知道的,都在这里。
如果 AI 引擎引用了我的页面,答案就一定写对了吗?
并不可靠。哥伦比亚大学 Tow 中心在 2024 年 11 月用 20 家出版机构的 200 条引文测试 ChatGPT Search,发现其中 153 条回答部分或完全错误,而系统只有 7 次承认自己答不上来;2025 年 3 月覆盖 1,600 条查询、八个引擎的后续研究发现超过 60% 返回了错误答案。另有研究发现,生成式搜索答案中只有 51.5% 的句子被其所挂的引用完全支撑。请把“被引用”当作相关性的证据,绝不要当作“被准确描述”的证据。
屏蔽 AI 爬虫能阻止引擎把我的产品写错吗?
不能,而且通常会让描述更糟。Tow 中心 2025 年 3 月的研究发现,屏蔽了爬虫的出版机构依然被引用,而授权协议同样没有带来准确性上的好处。它 2025 年 10 月的后续研究展示了屏蔽真正生效时会发生什么:引擎转而用推文、转载版本和第三方报道拼出一个复合答案。屏蔽改变的是“由哪些来源来描述你”,而不是“你会不会被描述”;何况智能体浏览器就是普通的 Chromium 会话,robots.txt 规则够不到它们。
我该怎么写,才能让 AI 答案引用得准确?
你希望被引用的每一句话,都要写成“整页删掉之后依然成立”。把主语、限定条件和日期放进句子内部:写「截至 2026 年 8 月 29 日,我们的入门方案为每月 99 美元按月计费」,而不是「这意味着它要 99 美元」。一份为期一年、覆盖 1,570 万条 AI Mode 引用的数据集,解析出 460 万条被高亮的段落,中位长度 117 词,其中约 85% 完全自足、80% 在第一句就给出答案。这个模式属于相关性证据,但它要防的那种失败并不是假想的。
被引用是不是意味着引擎挑到了可信来源?
不是。一项经同行评议的 EACL 2026 研究测量了聊天助手的“可信来源占比”,结果在 71.4% 到 86.3% 之间,取决于助手和话题;换个方向读,就是一条答案背后约有 14% 到 29% 的来源落在该研究的可信集合之外。另一项 2026 年的审计覆盖 ChatGPT、Copilot、Gemini 和 Perplexity 上的 712 个真实问题,在四个引擎上都发现了 AI 生成来源被引用的证据,约占被引来源的 16%。可信度和“确实支撑该说法”是两回事,而一次引用两者都不保证。
我能让 AI 引擎更正关于我公司的错误答案吗?
主流引擎都没有“更正入口”,所以现实路径是间接且缓慢的。把有争议的事实用纯服务端渲染的文字放到你自己的域名上,写成一句自足且带日期的句子;确认写错的那个引擎确实能抓到该页面,要查它的搜索爬虫令牌,而不是训练令牌;去看那条错误答案实际引用了什么,因为错误常常长在第三方页面而不是你的站上;并把错误连同引擎、prompt 和日期一起记录下来,这样你才能区分系统性问题和一次运气不好的抽样。
哪个 AI 引擎在引用来源上最准确?
被测的八个引擎表现都很差,而且这个排名已经旧到不该拿来做决策。在 Tow 中心 2025 年 3 月那项 1,600 条查询的研究中,表现最好的那个仍有 37% 的回答是错的;ChatGPT 错误指认了 134 篇文章,而在 200 条回答里只有 15 次表达了信心不足;表现最差的那个 94% 的情况下是错的,它在 200 条 prompt 上产生的引用里有 154 条指向错误页面。引擎行为在几个月内就会变,所以请把这个结论当作“到处都常见误述”,而不是一张排行榜。
负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。
发现数字有误?告诉我们,我们会重新核查:support@bavior.com