llms.txt 是一个简单的想法,却被过度炒作:在网站根目录放一个 markdown 文件,为大语言模型提供一份精选的重要页面地图。提案两年之后,是时候问几个成年人的问题了:到底谁在用它?有没有证据表明 AI 系统真的读它?如果你决定发布一份,一个好的文件应该长什么样?
本文只谈可以验证的内容,链接到原始数据,并对尚不确定的部分保持诚实。(如果你想先看入门介绍,请读《什么是 llms.txt?》——本文讨论的是 2026 年的采用现状与证据。)
60 秒回顾
这一标准由 Answer.AI 的 Jeremy Howard 于 2024 年 9 月提出(原始提案;完整规范见 llmstxt.org)。核心逻辑是:上下文窗口有限,而 HTML 页面充斥着导航、脚本和广告,所以不如在 /llms.txt 提供一份干净的、人工精选的 markdown 索引——一个标题、一段摘要,以及按主题分组的关键页面链接和一句话描述。可选的配套文件 llms-full.txt 则内联完整内容。
与 robots.txt 不同——后者告诉爬虫什么不能读,llms.txt 告诉 AI 系统什么最值得读。一个控制访问权限,另一个建议阅读优先级。
采用情况:基数虽小,增长真实
最连贯的纵向数据来自 Originality.AI 的公开追踪研究,它监测约三百万个网站上的 llms.txt 文件。追踪器在 2025 年 6 月记录到 4,088 个 llms.txt 文件,到 2026 年 5 月达到 36,120 个——十二个月增长 8.8 倍(来源)。
在热门网站中,一项 2026 年 5 月对 Tranco 前 10,000 个域名的独立抓取发现了 586 个有效的 llms.txt 文件——采用率 5.86%(来源)。这项研究里有一个值得停下来看的细节:在所有对 /llms.txt 返回 HTTP 200 的地址中,约 64% 未通过校验——跳转到首页、HTML 错误页、空文件。天真地统计 200 响应会把真实采用率高估近 3 倍,所以对任何没有校验环节的采用率标题都要保持怀疑。
采用者明显偏技术圈:开发者工具公司、文档站点和 AI 创业公司占据了公开目录的大头(llmstxt.site、directory.llmstxt.cloud)。Claude 背后的公司 Anthropic 也为自家文档发布了一份:docs.anthropic.com/llms.txt。
证据问题:到底有没有人读它?
下面是需要诚实的部分。截至本文写作时,没有任何主要 AI 厂商——OpenAI、Anthropic、Google、Perplexity——公开承诺在其生产环境的问答系统中消费 llms.txt。
被引用最多的怀疑者是 Google 的 John Mueller,他在 2025 年 4 月写道:“据我所知,没有任何 AI 服务表示他们在使用 llms.txt(看看你的服务器日志就知道,它们甚至不会请求这个文件)。在我看来,它类似于 keywords meta 标签”(经 Search Engine Journal 报道)。他后来又补充了一个更深层的论点:因为 llms.txt 是由想被选中的网站自我报告的,LLM 无法用它来区分相互竞争的网站——每个网站都会宣称自己最好(来源)。
从业者的反驳(例如 Search Engine Land 上的这篇)是:Mueller 的类比针对的是排名,而不是理解——llms.txt 从来不是作为排名信号提出的,而是为答题时抓取你网站的 AI 代理提供的便利;它是否被消费,最先体现在请求日志里,而不是官方声明里。两件事可以同时成立:这个文件可能帮助一个已经决定读你网站的代理,同时对让代理选择你毫无作用。
站在 RankedByAI 的角度,我们扫描过大量小企业网站,可以说的是:我们没有看到有说服力的公开证据表明,仅仅发布 llms.txt 就能改变一家企业在 AI 回答中被提及的频率。如果有人把 llms.txt 当作可见性灵丹妙药卖给你,捂好钱包。
那到底要不要发布?
我们的诚实立场:要——如果只花你十分钟,并且把预期摆正。
- 成本接近于零。它只是一个静态文本文件。没有惩罚,不影响抓取配额,除了维护之外没有任何坏处。
- 现实的收益是理解,不是排名。如果 AI 代理在回答问题时抓取你的网站,一份干净的精选索引只会帮它更快找到你的服务、地点和信任凭据。
- 投机性的收益是期权。如果哪家大厂开始消费这个文件,早期采用者不费吹灰之力就继承了红利。
llms.txt 不能替代的东西:可被抓取的页面(用我们的 AI 爬虫检测器检查你的 robots.txt——被屏蔽的爬虫也永远看不到你的 llms.txt)、清晰的服务页面、评论和第三方提及。这些才是被证明能推动 AI 推荐的信号。
如何写好一份 llms.txt
按照规范,格式是刻意极简的 markdown:
- 一个 H1,写你的网站或企业名——唯一必需的元素。
- 紧随其后的引用块:一两句话概括你做什么、为谁服务、在哪里。
- 用 H2 小节给链接分组——对企业来说,通常是服务、地点、信任凭据(评论、案例、资质)和联系方式。
- 每条链接独占一行:
[页面标题](URL): 一句话描述。 - 可选的
## Optional小节,放次要链接,上下文紧张时代理可以跳过。
区分有用文件和垃圾文件的实践规则:控制在几 KB 以内;用事实而非宣传语描述页面(记住 Mueller 的观点——自夸无法验证,因此会被忽略);只链接与决策最相关的页面,而不是站点地图里的每个 URL;页面变化时同步更新,因为过期的索引比没有索引更糟。
你可以在任何文本编辑器里手写这个文件,用我们免费的 llms.txt 生成器从线上站点直接生成,或者使用开源 CLI(npx rankedbyai llms-txt yoursite.com,GitHub 源码),它会根据你的站点地图和首页链接起草一份。
FAQ
llms.txt 能提升我在 ChatGPT 或 Perplexity 里的排名吗?
没有公开证据表明可以,也没有任何主要 AI 厂商宣布支持。把它当作对已访问你网站的代理的低成本理解辅助,而不是排名杠杆。真正被证明影响 AI 推荐的因素是可抓取性、清晰的事实页面、评论和第三方提及。
llms.txt 和 robots.txt 有什么区别?
robots.txt 控制访问:它告诉爬虫哪些路径可以或不可以抓取,主要 AI 爬虫确实遵守它。llms.txt 建议优先级:它提示哪些页面最重要并概括你的网站。一个有强制力,另一个只是建议——而且目前尚未确认被消费。
我还需要 llms-full.txt 吗?
多半不需要。全文变体主要适合文档类网站——它们的全部价值就是代理可能想一次性获取的文本。对典型的企业网站来说,一份精心筛选的索引文件已经覆盖了现实的使用场景。采用数据也印证了这个选择:在 2026 年 5 月的 Tranco 抓取中,拥有有效 llms.txt 的网站里只有约六分之一同时发布了有效的 llms-full.txt。
多久更新一次?
当被链接的页面发生实质变化时更新——新服务、新地点、页面改名。对多数小企业来说每季度检查一次就够了。如果你用工具生成文件,站点更新后重新生成,发布前对比一下差异。