先说结论:部署 llms.txt,并不会自动让 ChatGPT 引用你的品牌。它是一份放在网站根目录下的 Markdown 内容地图,帮助 AI Agent 和推理阶段的实时检索工具绕过网页中的导航栏、广告与 JavaScript,直接读取干净内容。用对了,可以降低 AI 的解析成本;用错了,就只是一份无人读取的文件。本文将一次讲清语法规范、部署位置、爬虫读取机制,以及它现阶段真实的能力边界。
什么是 llms.txt?它与 robots.txt 有什么区别?
llms.txt 是 Answer.AI 的 Jeremy Howard 于 2024 年 9 月提出的一项规范提案。文件名固定为 llms.txt,部署在域名根目录下,内容采用纯 Markdown。它的任务是“策展”:用精简清单列出整个网站中最值得 AI 阅读的页面,并为每个页面提供链接和说明。它不是配置文件,也不负责控制谁能访问网站。理解这一点,是后续实施的前提。
一份合格的 llms.txt 应该是什么样?
这项规范对格式的要求很轻,但内容顺序很重要。整个文件使用标准 Markdown 编写,语言模型几乎无需额外处理即可解析。文件从上到下可以采用以下结构:
- 一个 H1 标题,填写网站或项目名称。这是规范中唯一的必填项。
- 紧接着添加一段引用文字(以 > 开头),用一两句话说明网站提供什么内容或服务。这是 AI 抓取整份文件时首先读到的摘要。
- 如有必要,可再用几段普通文本补充背景或使用说明,但整份文件中不要出现第二个 H1。
- 设置若干 H2 区块,并在每个 H2 下放置 Markdown 链接列表。格式为 [页面名称] (网址):一句话说明。H2 用于分类,例如“服务”“文档”和“资源”。
- 可设置一个名为 ## Optional 的区块(可以省略)。这里列出的是次要内容;当 AI 上下文长度有限时,可以整体跳过。
llms.txt 应该放在哪里?需要提供什么格式?
部署位置没有变通空间:文件必须放在域名根目录下,URL 为 https://yourdomain/llms.txt。放进子目录或子域名,AI 就无法按约定找到它。文件编码使用 UTF-8,建议将服务器返回的 Content-Type 设置为 text/plain 或 text/markdown,不要让浏览器把它作为附件下载。另有两种配套做法值得一起考虑。第一种是可选的 llms-full.txt,把全站内容整合到一个大文件中,适合希望 AI 一次读完的场景;但它体积大、更新困难,中小型网站通常可以暂时不做。第二种是 .md 镜像页面,即在原 URL 后加上 .md,例如 /pricing 对应 /pricing.md,用来提供纯 Markdown 版本。这样,llms.txt 中的链接可以直接指向干净内容,而不是充满布局标签的 HTML。Tenten GEO 的 /pricing.md 就采用了这种方式,提供机器可读的定价信息。

AI 爬虫如何读取 llms.txt?
先区分两个经常被混为一谈的阶段。AI 接触网站内容主要有两个时间点:第一是训练阶段,GPTBot、ClaudeBot、Google-Extended 等爬虫大规模抓取网页,将内容用于模型训练;第二是推理阶段,用户提出问题后,AI 需要实时查询信息,由 PerplexityBot、ChatGPT 的浏览功能或各类 AI Agent 现场抓取内容。llms.txt 主要服务于后者。支持这项规范的工具会先抓取根目录下的 llms.txt,把它作为导航地图,判断下一步应展开并读取哪些链接,再获取对应的 Markdown。这样就能省去“下载整页 HTML、剥离导航栏与脚本,再判断哪一段是正文”的处理成本。
但必须明确一点:目前 OpenAI、Anthropic、Perplexity 和 Google 都没有公开承诺将 llms.txt 作为正式的训练或排名信号,Google 的态度尤其保留。现阶段,真正主动读取 llms.txt 的主要是开发者工具和 Agent 框架,例如部分代码助手、文件检索工具,以及自行搭建的 RAG 或 Agent 流程。因此,把 llms.txt 定位为“给 Agent 和自建检索铺路”,比把它包装成“AI 版 SEO 排名开关”更符合实际。
部署后如何验证?六个常见错误
- 位置放错:把文件塞进 /docs/llms.txt 或子域名,AI 根本找不到。按约定,它只识别域名根目录下的文件。
- 把它当成 robots.txt:在 llms.txt 中写 Disallow 来阻止爬虫。格式不对,不会产生任何效果。访问控制仍应通过 robots.txt 完成。
- 链接仍指向杂乱的 HTML:清单链接到充斥弹窗和侧边栏的页面,就没有节省解析成本。应尽量配套提供 .md 版本。
- 一次塞入过多链接:把全站几百个 URL 全部倒进去,会稀释重点。llms.txt 是内容策展,不是 sitemap。选择最希望获得引用的页面即可。
- 把说明写成营销话术:每个链接后的描述应该是一句事实说明,帮助 AI 判断是否需要继续展开,而不是广告口号。
- 上线后不再维护:网站改版、价格调整或页面下线后,如果 llms.txt 没有同步更新,AI 就可能读到过期信息,反而影响内容可信度。
验证并不复杂。首先,在浏览器中直接打开 https://yourdomain/llms.txt,确认返回的是纯文本、没有出现 404,也没有被浏览器作为文件下载。然后将完整内容粘贴到 ChatGPT 或 Claude,要求它“根据这份 llms.txt 说明该网站提供哪些服务”。如果它能准确复述,说明结构足够清晰,AI 可以理解。最后再检查 robots.txt,确认没有屏蔽你希望放行的 AI user-agent。这一步最容易被遗漏,却可能让前面的工作全部失效。
要不要做?什么时候做?
实话实说:llms.txt 成本低、风险小,值得做,但不要指望它单独带来引用增长。它只是整个 AI 品牌曝光工程中最外层、成本最低的一环。真正决定内容能否获得 AI 引用的,是内容本身能否被顺利抓取、品牌实体在 AI 看来是否足够可信,以及关键段落能否被直接提取。llms.txt 只是为这些内容铺好一条路;路上有没有值得运送的东西,最终仍取决于你的内容。
llms.txt 是一种便利机制,不是结果保证。它能让愿意读取你的 AI 更容易读懂内容,却无法迫使原本不读取的 AI 开始读取。— Tenten GEO
按照本文完成 llms.txt 部署后,下一个问题通常是:六大 AI 引擎是否已经读取并引用了我的内容?这个问题必须靠实测回答,不能凭猜测。如果你想了解自己的品牌曝光缺口,可以前往 /contact 预约一次 30 分钟的 GEO 诊断。我们会现场提供六大引擎的品牌曝光快照,并顺便检查你的 llms.txt 是否真的被读取。



