定义
llms.txt
llms.txt 是一个提议中的标准文件,告诉 LLM 和 AI 爬虫你的站点是做什么的、哪些页面最重要。规范、采用现状、怎么写一个,这篇讲清楚。
llms.txt 是放在站点根目录(/llms.txt)的 markdown 文件,给 LLM 和 AI agent 一份你内容的精选地图。由 Jeremy Howard 在 2024 年提出,填补一个 robots.txt 从来没设计过的空缺:robots.txt 说哪些可以被抓,llms.txt 说这个站点是什么、实质内容在哪。
格式
一个最小且合规的 llms.txt:
# Site Name
> One-sentence description of what this site is.
## Docs
- [Quickstart](https://example.com/docs/quickstart): Get running in 60 seconds
## Key Pages
- [Pricing](https://example.com/pricing): Plans and limits
实践中有效的约定:llms.txt 保持精简,是地图不是领土,同时在旁边提供 llms-full.txt 给想一次拿关键页全文的 agent。
它不是什么
- 不是许可系统。 拦一个 AI 爬虫要在 robots.txt 或 WAF 里做,不在这。
- 不是任何人确认过的排名因素。 它是上下文投递。读了好 llms.txt 的 agent 到你页面时,已经知道会找到什么。
- 不是 sitemap 替代品。 Sitemap 给爬虫列 URL;llms.txt 给模型策展含义。
怎么检查你的
站点审计工具把 llms.txt 的存在和结构作为 AI 就绪检查的一部分,连同 robots.txt 的 AI 爬虫规则和 FAQ schema。这个检查刻意无趣:文件存在、加载快、链接可达、描述齐全,agent 需要的就这些。
相关概念
常见问题
llms.txt 是什么?
llms.txt 是放在站点根目录的 markdown 格式文件,给 LLM 和 AI agent 一份你内容的精选地图,站点是什么、什么重要、去哪找。由 Jeremy Howard 在 2024 年 9 月提出,类比 robots.txt,但服务于 AI 消费而不是抓取许可。
AI 搜索引擎真的会读 llms.txt 吗?
主流引擎的采用是部分的、未文档化的,但 AI agent 和第三方爬虫越来越多地在抓它,而且提供它零成本。把它当渐进增强:robots.txt 管抓取,llms.txt 管理解。提供它的站点报告 AI agent 带着更好的上下文到来。
llms.txt 和 robots.txt 有什么区别?
robots.txt 是所有爬虫读的抓取许可文件,它说哪些可以被fetch。llms.txt 是 LLM agent 读的内容地图,它说这个站点是什么、哪些 URL 承载实质内容。两个都需要,它们回答不同的问题。
llms-full.txt 是什么?
配套约定:llms.txt 保持精简只放链接,llms-full.txt 则内联关键页面的全文,给偏好一次性拿大文档的 agent。两个都提供,轻量 agent 拿地图,重型 agent 拿全部。
相关词条
- Agent 就绪度 — Agent 就绪度衡量的不只是爬虫能不能抓你,而是 AI agent 能不能真正用你的站点:结构化端点、机器可读文档、MCP 服务、明确的自动化使用条款。
- GEO 评分 — GEO 评分衡量你的站点对 AI 答案引擎的可检索、可理解、可引用程度。
- 查询扇出(Query Fan-Out) — 查询扇出是 AI 搜索引擎在组装答案前,把一个问题拆成多个子查询的机制。