← 术语表

定义

llms.txt

llms.txt 是一个提议中的标准文件,告诉 LLM 和 AI 爬虫你的站点是做什么的、哪些页面最重要。规范、采用现状、怎么写一个,这篇讲清楚。

llms.txt 是放在站点根目录(/llms.txt)的 markdown 文件,给 LLM 和 AI agent 一份你内容的精选地图。由 Jeremy Howard 在 2024 年提出,填补一个 robots.txt 从来没设计过的空缺:robots.txt 说哪些可以被抓,llms.txt 说这个站点是什么、实质内容在哪。

格式

一个最小且合规的 llms.txt:

# Site Name

> One-sentence description of what this site is.

## Docs
- [Quickstart](https://example.com/docs/quickstart): Get running in 60 seconds

## Key Pages
- [Pricing](https://example.com/pricing): Plans and limits

实践中有效的约定:llms.txt 保持精简,是地图不是领土,同时在旁边提供 llms-full.txt 给想一次拿关键页全文的 agent。

它不是什么

  • 不是许可系统。 拦一个 AI 爬虫要在 robots.txt 或 WAF 里做,不在这。
  • 不是任何人确认过的排名因素。 它是上下文投递。读了好 llms.txt 的 agent 到你页面时,已经知道会找到什么。
  • 不是 sitemap 替代品。 Sitemap 给爬虫列 URL;llms.txt 给模型策展含义。

怎么检查你的

站点审计工具把 llms.txt 的存在和结构作为 AI 就绪检查的一部分,连同 robots.txt 的 AI 爬虫规则和 FAQ schema。这个检查刻意无趣:文件存在、加载快、链接可达、描述齐全,agent 需要的就这些。

相关概念

常见问题

llms.txt 是什么?

llms.txt 是放在站点根目录的 markdown 格式文件,给 LLM 和 AI agent 一份你内容的精选地图,站点是什么、什么重要、去哪找。由 Jeremy Howard 在 2024 年 9 月提出,类比 robots.txt,但服务于 AI 消费而不是抓取许可。

AI 搜索引擎真的会读 llms.txt 吗?

主流引擎的采用是部分的、未文档化的,但 AI agent 和第三方爬虫越来越多地在抓它,而且提供它零成本。把它当渐进增强:robots.txt 管抓取,llms.txt 管理解。提供它的站点报告 AI agent 带着更好的上下文到来。

llms.txt 和 robots.txt 有什么区别?

robots.txt 是所有爬虫读的抓取许可文件,它说哪些可以被fetch。llms.txt 是 LLM agent 读的内容地图,它说这个站点是什么、哪些 URL 承载实质内容。两个都需要,它们回答不同的问题。

llms-full.txt 是什么?

配套约定:llms.txt 保持精简只放链接,llms-full.txt 则内联关键页面的全文,给偏好一次性拿大文档的 agent。两个都提供,轻量 agent 拿地图,重型 agent 拿全部。

相关词条

  • Agent 就绪度 Agent 就绪度衡量的不只是爬虫能不能抓你,而是 AI agent 能不能真正用你的站点:结构化端点、机器可读文档、MCP 服务、明确的自动化使用条款。
  • GEO 评分 GEO 评分衡量你的站点对 AI 答案引擎的可检索、可理解、可引用程度。
  • 查询扇出(Query Fan-Out) 查询扇出是 AI 搜索引擎在组装答案前,把一个问题拆成多个子查询的机制。