llms.txt 从哪来?定位是什么?
llms.txt 由 Answer.AI 的 Jeremy Howard 在 2024 年 9 月提出,动机很实际:网页塞满导览、广告与脚本,对上下文长度有限的语言模型不友善,不如提供一份干净的 Markdown 摘要,列出网站是什么、重点页面在哪。要注意它的身分:这是社群提案,不是任何搜索引擎或 AI 平台的官方标准——这个定位决定了你该投资多少心力在上面。
llms.txt 是 2024 年由社群提出的档案格式提案,用一份精简的 Markdown 让 AI 系统快速理解网站结构与重点内容。本站有部署它,但我们要先把话说在前面:Google 已表明不使用 llms.txt,它不是收录或引用的门票。这篇文章教你怎么做,也告诉你该对它抱多少期待。
llms.txt 由 Answer.AI 的 Jeremy Howard 在 2024 年 9 月提出,动机很实际:网页塞满导览、广告与脚本,对上下文长度有限的语言模型不友善,不如提供一份干净的 Markdown 摘要,列出网站是什么、重点页面在哪。要注意它的身分:这是社群提案,不是任何搜索引擎或 AI 平台的官方标准——这个定位决定了你该投资多少心力在上面。
规范刻意简单,就是一份放在网站根目录的 Markdown 档。结构依序是:H1 写网站名称、引言区块(blockquote)写一段网站摘要、之后用 H2 分区放连结清单,每个连结附一句说明。另外有一个选配的 llms-full.txt,直接放入完整的页面内容,给愿意读长文件的系统使用。两个档案都以纯文字回应,不需要任何特殊标头。
我们在 Next.js App Router 用 Route Handler 提供 /llms.txt 与 /llms-full.txt,内容不是手写的静态档,而是从跟网页同一份资料层(服务、案例、价格的 TypeScript 内容档)动态组出来,并以 force-static 在建置时输出。这个设计解决了手写档案最大的问题:内容漂移。价格改了、服务改了,llms.txt 在下次建置自动同步,不会出现网页说一套、llms.txt 说另一套的情况——对 AI 系统输出过期资讯,比没有这个档案更糟。
这是多数教学不会告诉你的部分。Google 官方文件明确说明 AI 功能没有额外的技术门槛,搜索团队成员也公开表示不使用 llms.txt;其他 AI 平台是否读取、读了是否影响引用,目前都没有官方承诺。我们检视自己的服务器纪录,能看到部分 AI 爬虫抓取过这两个档案,但「被抓取」与「影响引用」是两件事,后者无法验证。所以我们的结论是:llms.txt 是成本极低的补充措施,不是 GEO 的核心工作——真正的核心仍是可索引的内容与一手证据。
值得做的理由:成本极低(一个档案)、没有任何已知风险、万一未来有平台正式采用你已就位。不值得投入的情况:有人要你为此付顾问费,或把它包装成「AI 收录必备」来卖——这与平台官方立场不符,可以直接当成判断厂商诚信的试金石。我们对客户的说法是一致的:做,但它排在技术 SEO、内容证据与量测之后,优先序很后面。
三件事:一是用 curl 或浏览器直接开 /llms.txt,确认回应 200、内容是最新的;二是检查内容过滤与 sitemap 一致——noindex 的页面不应该出现在 llms.txt 里,否则等于把你不想曝光的内容主动递给 AI;三是定期看服务器纪录,记录哪些爬虫实际抓取过,这是你判断「有没有人在读」的唯一一手资料。