llms.txt 究竟是什么
llms.txt 是放在 /llms.txt 的纯文本(Markdown)文件,为 AI 系统提供你网站的精选摘要:网站是什么、哪些页面最重要,并附简短描述。这一约定由 Jeremy Howard(Answer.AI)于 2024 年 9 月提出,作为 robots.txt 的对应物——robots.txt 告诉爬虫可以读什么,llms.txt 告诉语言模型应该读什么、如何理解。
格式刻意保持简单:一个 H1 写站点或产品名,一段 blockquote 摘要,然后是带一行描述的链接分组。因为它是位于可预测 URL 的简短干净的 Markdown,AI 系统(或代用户浏览的 agent)一次请求即可读完,而无需爬取几十个充满导航和 cookie 横幅的模板化 HTML 页面。
2026 年的诚实现状:有前景,无保证
警惕任何把 llms.txt 当作神奇排名杠杆来卖的人。主要 AI 公司尚未像搜索引擎承诺支持 sitemap 那样正式承诺消费它,直接影响排名的公开证据也很薄弱。确实成立的是:它在开发者工具和 SaaS 公司中的采用不断扩大,越来越多的 agent 和 AI 开发工具会抓取该文件,而维护它几乎零成本。
合理的看法是一笔不对称的赌注:五分钟的工作、零负面、随着 agent 式浏览增长而有可观上行。它还兼具真正的实用价值——一份对最重要页面的规范化、自我审计的摘要。许多团队在撰写时才发现自己的「赚钱页面」很难描述清楚,这本身就是值得知道的内容问题。
写好一份 llms.txt
以清晰开头,而不是营销。blockquote 摘要应该用平实的陈述语言说明你做什么、为谁服务——就像向一个有能力的陌生人解释你的业务那样。每个链接都应回答 AI 可能需要的问题:产品多少钱(定价页)、如何运作(文档或方法论)、证据在哪(案例)、最近有什么变化(changelog)。
保持在几百行以内,并在网站结构变化时更新。不要罗列每篇博客;只列你希望被引用的页面。如果你同时维护 llms.txt 和更完整的 llms-full.txt,短文件必须真正保持短。并确保所链接的页面本身可被爬取——指向被爬虫拦截页面的 llms.txt 是自我拆台(可用我们的 AI 爬虫检测器检查)。
文件之外:让机器读得懂你
llms.txt 只是更大范畴(有时称为 GEO,生成式引擎优化)中的一环:把网站结构化,让机器能够理解并放心引用。清单的其余部分:关键页面服务端渲染 HTML、JSON-LD 结构化数据(Organization、Product、FAQPage)、全网一致的企业名称/地址/电话、真实的第三方引用(目录、评价、媒体报道),以及直接回答买家向助手提问的内容。
度量闭环。发布 llms.txt 和内容修复之后,问题在于 AI 的回答是否真的变了。这正是 Geovory 免费扫描提供的:AI 今天推荐你的频率基线,以及每周监测你的改动是否在起作用。