首页/学习 GEO/长度、schema 与 llms.txt
专题 · 面向 AI 引用的内容

长度、schema 与 llms.txt:证据到底说了什么?

这是创业者问得最多的三个技巧,也是背后证据最薄的三个。本页把每一个被跑过的研究点名列出:谁做的,以及它的样本在结构上注定看不到什么。

本页内容
分享本文
分享到 X 分享到 LinkedIn
简短回答

三者之中只有一个有第一方答案,而它把三样一起否掉了:Google 关于其生成式 AI 功能的指南写明“不存在理想页面长度”、“没有你必须添加的特殊 schema.org 标记”,以及一个 LLMS.txt 文件“既不会伤害也不会帮助”,因为 Search 会忽略它。1 其余全部来自观察性数据,而它们没有一份是为了回答人们拿去问它的那个问题而设计的,所以三个流行说法都属于“缺乏支持”,而不是“已被证伪”。唯一一次带对照组的前后测(1,885 个新增 JSON-LD 的页面对比 4,000 个配对对照页)测得 AI Overview 引用变动 −4.6%,另外两个界面与零无异。8

关键要点
  • 唯一同时覆盖这三样的第一方文档把三样一起否掉了,而且写在同一份“可以忽略的事情”清单里,最后更新于 2026 年 7 月 10 日。
  • 两份大型长度数据集指向相反方向,因为它们测的是不同结果,而且两份里都没有哪怕一个“未被引用”的页面可供比较。
  • 结构化数据只有一次配对前后测。它在 AI Overviews 上测出一个小幅负值,其他地方什么都没有;而让这个技巧流行起来的,是一个大约三比一的原始相关性。
  • 没有任何引擎在文档里说自己会读 llms.txt。四家 AI 厂商为自己的开发者文档发布了这个文件,却没有一家写明自己会消费它;服务器日志显示,请求几乎都来自 SEO 审计工具。
记分板

这三样各自的证据状态是什么?

每一行写出现存最强的那次测试,以及那次测试因为设计方式而注定看不到的东西。

杠杆现存最强的一次测试那次测试看不到什么
页面长度两份观察性数据集:174,048 个被引用页面,以及 18,151 个被抓取并评过影响力的页面两份都没有“未被引用”的对照组,因此都无法估计某个字数下被引用的概率
schema 标记一次配对双重差分测试:1,885 个新增 JSON-LD 的页面对比 4,000 个对照页在所测三个界面之外的引擎上,或在更长的时间窗里,schema 标记是否会提升 AI 引用
llms.txt一次覆盖 37,894 个已被引用域名的横截面,外加两项“谁在请求该文件”的服务器日志研究对一个完全没有被引用过的站点,llms.txt 是否有帮助;任何样本里都没有这样的站点

这三个问题都被当成“答案是一个数字”来问,而三个的诚实答案都是对一次研究设计的描述。形状是重复的:存在一个很大的原始相关性并被到处转发,唯一一次为了把因果与相关分开而设计的测试测出的结果小得多甚至为零,而引擎自己的文档说这东西从来就不是一个杠杆。什么样的内容会被引用讲的是这条线另一侧的技巧,也就是有旁证支撑的那些。

长度

页面长度会改变你是否被引用吗?

没有人跑过能回答这个问题的研究,而 Google 的立场是这个问题本身就没提对。它那份关于生成式 AI 功能的指南(最后更新于 2026 年 7 月 10 日)把内容长度归进“可以忽略的事情”:“并不要求你把内容切成很小的碎片好让 AI 更好理解……不存在理想页面长度;说到底,是为你的受众做页面,而不只是为生成式 AI 搜索做页面。”1

被拿来替代的那个数字是描述性的。2025 年 12 月的一份行业分析覆盖 560,346 条 AI Overviews 与 1,677,876 个被引用 URL,收窄到其中 174,048 个能提取正文的页面,报告被引用页面平均 1,282 词,而自然排名页面为 1,188 词;被引用页面中 53.4% 不到 1,000 词,30.6% 在 1,000 到 2,000 词之间,16% 超过 2,000 词。9 该研究由厂商发布,因此这里只描述不链接。

在读那个中位数之前,先读清楚样本是什么。里面每一个页面都已经被引用过了;旁边没有一组未被引用的页面。一个没有比较组的数据集能告诉你被引用的页面长什么样,但无法告诉你一个 2,400 词的页面比一个 700 词的页面被引用的可能性高多少。把它的中位数变成一份内容简报,就是把一次人口普查当成了一张处方,而这正是整个话题里最常见的那个错误。

同一份研究报告的唯一一个关系型数字,是字数与该页在概览中引用位次之间 0.04 的 Spearman 相关,且第一到第三位的平均长度几乎持平。在已经被选中的页面之间,长度并不预测它们落在哪一位。

另一份数据集

为什么那份学术数据集指向相反方向?

因为它在另一个样本上测的是另一个结果,而两个结果一旦对齐就并不冲突。张、何与姚 2026 年的测量框架把“引用选择”(引擎选中了你)与“引用吸收”(你的措辞真的进了答案)分开。在 602 条受控 prompt、21,143 条检索层引用和 18,151 个成功抓取的页面上,影响力最高的四分之一平均 1,943.30 词,最低的四分之一平均 169.82 词,比值 11.44 倍;其字数分箱一路上升到 3,000 词以上,并在 301 到 1,000 词处有一个局部平台。3

先看最低那一档,再看那个比值。平均 169.82 词是一张残页:一个标签页、一条单薄的支持说明、一段产品简介。11.44 倍的对比是“一篇真文章对一个碎片”,它完全不包含“一篇 1,200 词的文章该不该扩成 3,000 词”的任何信息。

作者自己就是这么说的。字数“单独看是一个不完整的代理指标”,而他们报告的最强单一相关并不是长度,而是 LLM 相关性评分 r = 0.4322,高于答案与引用之间的嵌入相似度 0.3561;总结句写得很直白:“页面字数与结构标记是有作用的,但语义契合比一个简单的长度信号更强。”3 他们提出的“证据容器”读法才是有用的那个:当多出来的篇幅是更多小标题、更多互不重复的论断和更多可提取的证据时,更长的页面才有帮助;当它是套话时,什么也不会发生。

结构化数据

schema 标记会改变 AI 引用吗?

这是唯一一个真有人把实验好好做了一遍的案例,而相关性与实验的差距,恰好等于那个主张的全部大小。

先从让这个技巧流行起来的那个相关性说起:在同一家厂商的数据里,被 AI 引用的页面带 JSON-LD 的概率差不多是未被引用页面的三倍。这个差距是真的,也正是最后被搬上会议幻灯片的那个数字。然后同一批人去找了箭头的方向。

2026 年 5 月发布:1,885 个在 2025 年 8 月至 2026 年 3 月间引入 JSON-LD 的页面,配对 4,000 个对照页面,用配对双重差分做分析,好让全平台趋势相互抵消。Google AI Overviews 变动 −4.6%,被描述为相对配对对照“小但统计显著”;Google AI Mode 为 +2.4%,ChatGPT 为 +2.2%,两者都与零无从区分。8 “schema 标记能提升 AI 引用率”这个说法得不到那次测试的支持,而那是同类测试中唯一存在的一次。

这个负值也不该被过度解读。两组本来就都在下滑,实验组只是掉得稍快一点;少数极端离群值把实验组的均值往下拽,把它们剔掉之后两组看起来大致一样。站得住脚的说法是“加标记没有测出可观察的效果”,而不是“它有害”。

第一方文档的口径一致,而且值得从两个页面分别引用,因为它们是措辞不同的两个页面,一个日期戳盖不住两处。《AI features and your website》(最后更新于 2025 年 12 月 10 日)写道“也不存在你必须添加的特殊 schema.org 结构化数据”,同时要求你确保已有的结构化数据“与页面上可见的文本一致”。2 七个月后的那份优化指南把它归进“过度关注结构化数据”,并保留了继续上它的真正理由:它“有助于让你有资格获得 Google 搜索的富媒体结果”。1 schema 依然有它的活儿要干。只是那不是它被拿去兜售的那个活儿。

llms.txt

到底有没有东西真的会读你的 llms.txt?

没有任何有文档记录的东西会读它,而这个文件的作者本人也从没说过它会。这份提案标注日期为 2024 年 9 月 3 日、2026 年 8 月 10 日修订为第二版,它把该文件的用途限定为“智能体在需要某样东西的当下去抓取一个站点”:llms.txt 的信息“是按需使用的,是在一个智能体在协助用户时需要某个话题的信息时使用的”,而当初的预期是它“主要……对推理而不是训练有用”。5 “被一个带搜索的答案引用”并不是这份文档里包含的用例。

“一个 llms.txt 文件有助于页面被引用”这个说法,没有任何第一方文档支持,被迄今发表的每一份服务器日志所反驳,也被唯一一次大规模横截面研究所否定。Google 直接点了这个文件的名:创建并维护一个这样的文件“既不会伤害也不会帮助你的站点在 Google 搜索中的可见度或排名,因为 Google 搜索会忽略它们”。1

真正让人困惑的一点是,AI 公司自己会发布这个文件。Anthropic、OpenAI、Perplexity 和 Cloudflare 都为自己的开发者文档提供了 llms.txt,四份在 2026 年 8 月 30 日核查时都能返回内容。6 为编码智能体发布一张地图,和在生成带搜索的答案时去消费一张地图,是两件不同的事;四家里没有一家在文档里说自己做了后一件。

存在两类测量。2026 年 3 月的一次横截面取了 37,894 个在 AI 答案中至少被引用过两次的域名(来自 882 份品牌快照与 33.7 万条以上的引用),发现其中 13.3% 带有该文件;采用者平均 6.8 次引用,未采用者 6.7 次,中位数同为 3.0,Mann-Whitney U 检验 p = 0.85。7 它自己那条“同一比较在全量规模上会变得显著,效应量 r = −0.065”的注记才是关键:这就是同一项研究如何被朝两个相反方向引用的原因。

服务器日志问的是更粗糙也更干净的问题:谁在请求这个文件。某位站点运营者一个月的日志记录到 52 次对 /llms.txt 的请求,每一次都来自 SEO 审计工具,没有一次来自 AI 爬虫;在同一份分析覆盖的更大托管集群上,4 亿次请求中约有 5,000 次落在该文件上。另一项为期 90 天的研究记录到 62,100 次 AI 机器人访问中有 84 次去了 /llms.txt,而该站点普通内容页平均约为 265 次。10

方法

怎么分辨一次真正的测试和一个相关性?

四个问题几乎能了结你会看到的每一个 GEO 主张,而四个都能从研究自己的描述里找到答案。有东西被改动过吗,还是只是把本来就不同的页面拿来比?有没有一个没被改动的对照组,好让全平台的趋势不被误当成你的效果?谁被排除在样本之外,而那个被排除的群体是不是恰好就是你所属的那一类?以及测的是哪个结果,毕竟“在列表里的位次”“对措辞的影响”和“到底会不会被引用”,是三个各走各路的变量。

2026 年那份批判性综述把同一点写成了一条协议要求:“内容改动、内部链接、结构化数据、域名声誉和爬虫可达性,必须被分开。”4 它的置信度表随后把“引用分数能预测点击、转化或收入”评为极低;当一个仪表盘递给你一个会动的单一数字时,这条值得记住。从 SEO 延续下来的东西把同一套检验用在了那些经得起检验的杠杆上。

本页的诚实边界

这里描述的研究中有四项由厂商发布,公司之外的任何人都无法复跑:数据没有公开,抽样框是一段话而不是一节方法,而每家厂商都在卖某种能从该结论里获益的东西。引用它们,是因为它们是这些问题现存的全部测试,而不是因为它们强。学术来源那一份是基于 602 条 prompt 的预印本。而这种形状的样本里出现零结果,并不证明任何地方都不存在效应:它的意思是,在这些引擎上、在这些时间窗里、在这种设计能察觉的量级上,还没有人找到过。

产品在哪里派得上用场,在哪里派不上

本页的三个问题都在任何工具介入之前就已经定了:对着问题写而不是对着字数写;把结构化数据留给它能挣到的富媒体结果;把花在 llms.txt 上的那一小时,改花在能真正改变某个检索环节的事情上。Bavior 无法告诉你“加了标记或加了那个文本文件会不会有帮助”,任何测量类产品都不能,因为事后对答案做抽样,无法把你的这次改动和那一周里动过的其他一切分开。它能做的更窄:按计划把一组固定的 prompt 打到五个引擎上,逐次记录每条答案引用了哪些来源,从而给你一次真正的测试所需要的前后序列,但它依然不提供对照组。免费 GEO 体检免费 AI 可见性检测不需要付费方案;付费方案为按月支付每月 99 美元起,或按年支付每月 79.17 美元(截至 2026 年 8 月 30 日)。

出处,全部核查于 2026 年 8 月 30 日
  1. Google Search Central,《Google’s Guide to Optimizing for Generative AI Features on Google Search》,最后更新于 2026 年 7 月 10 日(第一方;“不存在理想页面长度”、LLMS.txt 相关表述、“过度关注结构化数据”):developers.google.com/search/docs/fundamentals/ai-optimization-guide
  2. Google Search Central,《AI features and your website》,最后更新于 2025 年 12 月 10 日(第一方;措辞不同的另一个页面:“不存在你必须添加的特殊 schema.org 结构化数据”):developers.google.com/search/docs/appearance/ai-features
  3. Zhang Kai、He Xinyue、Yao Jingang,《From Citation Selection to Citation Absorption》,arXiv:2604.25707v2,2026 年 4 月 29 日(预印本,开放数据集);602 条 prompt、21,143 条引用、18,151 个被抓取页面、72 个特征;§8.1 字数四分位、§8.2 相关性:arxiv.org/abs/2604.25707
  4. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(预印本);混杂因素分离协议,以及表 5 把“引用分数预测收入”评为极低:arxiv.org/abs/2607.14035
  5. Jeremy Howard,《The /llms.txt file, v2》,日期 2024 年 9 月 3 日,修订于 2026 年 8 月 10 日(提案本身,第一方):github.com/AnswerDotAI/llms-txt
  6. 四家厂商为自己的开发者文档发布的 llms.txt,2026 年 8 月 30 日抓取时全部返回内容:docs.anthropic.com/llms.txtdevelopers.openai.com/llms.txtdocs.perplexity.ai/llms.txtdevelopers.cloudflare.com/llms.txt
  7. llms.txt 横截面研究,2026 年 3 月 19 日发布:37,894 个至少被引用两次的域名,来自 882 份品牌快照与 33.7 万条以上引用;采用率 13.3%;平均引用 6.8 对 6.7,中位数均为 3.0,Mann-Whitney U 检验 p = 0.85,全量规模下 r = −0.065。厂商发布;仅描述不链接。
  8. schema 双重差分测试,2026 年 5 月 11 日发布:1,885 个在 2025 年 8 月至 2026 年 3 月间新增 JSON-LD 的页面对比 4,000 个配对对照页;AI Overviews −4.6%、AI Mode +2.4%、ChatGPT +2.2%;在原始横截面中,被 AI 引用的页面带 JSON-LD 的概率差不多是三倍。厂商发布;仅描述不链接。
  9. 内容长度分析,2025 年 12 月 3 日发布:560,346 条 AI Overviews、1,677,876 个被引用 URL、174,048 个可提取正文的页面;平均 1,282 词,自然排名页面为 1,188 词;53.4% 不到 1,000 词;与引用位次的 Spearman 相关为 0.04。厂商发布;仅描述不链接。
  10. 两项关于“谁在请求 /llms.txt”的服务器日志研究:某站点运营者一个月的日志(52 次请求全部来自 SEO 审计工具,加上整个托管集群 4 亿次请求中约 5,000 次),2026 年 3 月 5 日发布;以及一项 90 天研究(62,100 次 AI 机器人访问中有 84 次),2026 年 2 月 5 日发布。个人博客与厂商博客;仅描述不链接。
常见问题

你想知道的,都在这里。

一个页面要多长才能被 AI 搜索引用?

没有任何有证据支撑的数字,而且 Google 自己的指南写明“不存在理想页面长度”。被引用最多的那个数据,即 174,048 个被引用页面平均 1,282 词,描述的是“已经被引用的页面长什么样”,而不是“它们因为长度而被选中”,其中 53.4% 还不到 1,000 词。把问题答完就停笔。

为了被 AI 引用,我该加 schema 标记吗?

为富媒体结果加,那是它真正能兑现的收益。唯一一次配对前后测(1,885 个新增 JSON-LD 的页面对比 4,000 个对照页)发现 AI Overview 引用下降了 4.6%,其余界面与零无异;Google 也写明,为其 AI 功能你并不需要添加任何特殊的 schema.org 标记。留着它,但别替它多领功劳。

我的站点需要一个 llms.txt 文件吗?

没有任何一个有文档记录的搜索引擎会读它。Google 写明该文件既不会伤害也不会帮助,因为 Search 直接忽略它;提案作者本人把它的用途限定在“智能体按需抓取”,而不是搜索引用;两项服务器日志研究发现,请求几乎全部来自 SEO 审计工具。如果某个智能体集成需要它就发布一份,但别把它算进可见度。

为什么这么多 GEO 指南还在推荐这三样?

因为每一样背后都有一个很大的原始相关性,而相关性做起来很便宜。被引用的页面确实大约有三倍的概率带 JSON-LD,被引用的页面平均字数确实也比残页多。缺的那一步是对照组,而在唯一一次有人补上对照组的场合里,效应就消失了。请追问:那项研究到底改动了什么,又是拿什么来做比较的。

Bavior 编辑部

负责调研与维护 Bavior 关于 Reddit 营销和 AI 搜索可见度的全部内容。文中每一个数字都注明了来源出处与核查日期,所有外链均非联盟推广链接。

发现数字有误?告诉我们,我们会重新核查:support@bavior.com

三个技巧,只有一个有对照组。
去测真正动了的那部分。

免费试用