llms.txt는 2024년에 커뮤니티에서 제안한 파일 형식으로, 간결한 마크다운 형식을 사용하여 AI 시스템이 웹사이트 구조와 주요 내용을 빠르게 이해하도록 돕습니다. 저희 웹사이트에서도 이 형식을 사용하고 있지만, 먼저 중요한 내용을 말씀드리겠습니다. 구글은 llms.txt를 사용하지 않음을 명확히 밝혔으며, 이는 웹사이트를 포함하거나 참조하는 데 사용될 수 있는 방법이 아닙니다. 이 글에서는 이 형식을 사용하는 방법을 알려드리고, 이 형식을 기대하는 정도에 대해 설명합니다.
"llms.txt"는 2024년 9월 제레미 하워드가 Answer.AI에서 제안했으며, 그 배경에는 실질적인 동기가 있었습니다. 웹 페이지가 길고, 광고와 스크립트로 가득 차 있어, 문맥 길이에 제한적인 언어 모델에게는 적합하지 않다는 점을 고려하여, 웹사이트의 내용과 주요 페이지를 요약한 깔끔한 Markdown 형식으로 제공하는 것이 더 효과적이라는 것입니다. 이 제안의 중요한 점은, 이것이 커뮤니티 제안이며, 어떤 검색 엔진이나 AI 플랫폼의 공식 표준이 아니라는 것입니다. 따라서 이 제안에 얼마나 많은 노력을 투자할지는 여러분이 결정해야 합니다.
형식은 어떤 형태인가요?
규칙을 의도적으로 단순화하여, 웹사이트의 루트 디렉토리에 있는 Markdown 파일 하나만 사용합니다. 파일 구조는 다음과 같습니다.; H1 태그에는 웹사이트 이름,; 인용 블록(blockquote)에는 웹사이트 요약,; H2 태그를 사용하여 링크 목록을 구성하고, 각 링크마다 설명을 추가합니다. 또한, 선택적으로 사용할 수 있는 llms-full.txt 파일은 전체 페이지 내용을 직접 포함하여, 긴 문서를 읽어주는 시스템에 유용합니다. 두 파일 모두 일반 텍스트 형식이며, 특별한 헤더가 필요하지 않습니다.
H1: 웹사이트 또는 프로젝트 이름(필수)
인용구: 웹사이트의 특정 구절을 요약한 내용
H2 섹션: 분류별 링크 목록, 각 링크마다 설명 포함
llms-full.txt (선택 사항): 전체 내용의 확장 버전
본 웹사이트의 특징: 동적 생성, 수동 입력 없음
Next.js App Router에서 Route Handler를 사용하여 `/llms.txt` 및 `/llms-full.txt` 파일을 제공합니다. 이 파일들은 수동으로 작성된 정적 파일이 아니라, 웹 페이지와 동일한 데이터 레이어(TypeScript 파일, 즉 서비스, 사례, 가격 정보)에서 동적으로 생성되며, 빌드 시 `force-static` 방식으로 출력됩니다. 이러한 설계는 수동 파일의 가장 큰 문제인 '내용 불일치' 문제를 해결합니다. 가격이나 서비스가 변경되면, `llms.txt` 파일은 다음 빌드 시 자동으로 동기화되어 웹 페이지와 `llms.txt` 파일 간의 내용 불일치 상황이 발생하지 않습니다. 이는 AI 시스템에 오래된 정보를 제공하는 것보다 훨씬 낫습니다.
결과에 대한 솔직한 평가: 구글은 이를 사용하지 않습니다
대부분의 교육 과정에서 다루지 않는 부분입니다. 구글 공식 문서는 AI 기능에 특별한 기술적 장벽이 없음을 명확히 밝히고 있으며, 검색팀 구성원들도 llms.txt 파일을 사용하지 않는다고 공개적으로 밝혔습니다. 다른 AI 플랫폼이 해당 파일을 읽거나 읽은 것이 인용에 영향을 미치는지에 대한 공식적인 약속은 아직 없습니다. 저희는 자체 서버 기록을 검토한 결과, 일부 AI 봇이 해당 두 파일을 수집한 것을 확인할 수 있지만, "수집"과 "인용에 영향"은 별개의 문제입니다. 후자의 경우, 이를 검증할 수 없습니다. 따라서 저희의 결론은 다음과 같습니다. llms.txt는 매우 저렴한 보조적인 방법이며, GEO의 핵심 업무가 아닙니다. 핵심은 여전히 인덱싱 가능한 콘텐츠와 원본 증거입니다.
어떤 것을 도입해야 할까요? 판단 방법
추천하는 이유: 비용이 매우 저렴 (단 하나의 파일), 알려진 위험이 없고, 만약 향후 플랫폼에서 실제로 사용될 경우 유용합니다. 추천하지 않는 이유: 누군가가 이 서비스를 통해 컨설팅 비용을 청구하거나, "AI 필수 도구"로 판매하려 할 경우 – 이는 플랫폼의 공식적인 입장을 벗어나며, 이는 해당 업체의 신뢰도를 판단하는 기준으로 활용될 수 있습니다. 저희는 고객에게 다음과 같이 설명합니다: "이 서비스를 활용하는 것이 좋지만, 기술 SEO, 콘텐츠 증거, 측정 등의 우선순위는 낮습니다."
배포 후에는 어떻게 검증해야 하나요?
세 가지 사항: 첫째, `curl` 또는 브라우저를 사용하여 `/llms.txt` 파일을 직접 열어 응답이 200 상태인지, 내용이 최신인지 확인합니다. 둘째, 콘텐츠 필터링 및 사이트맵과의 일관성을 확인합니다. `noindex`로 지정된 페이지는 `/llms.txt`에 나타나서는 안 되며, 이는 원치 않는 콘텐츠를 AI에게 직접 제공하는 것과 같습니다. 셋째, 서버 로그를 정기적으로 확인하여 실제로 어떤 크롤러가 데이터를 수집했는지 기록합니다. 이는 "누군가 읽고 있는지"를 판단하는 유일한 직접적인 증거입니다.
sitemap.xml는 검색 엔진에서 공식적으로 지원하는 표준으로, 검색 엔진이 크롤링할 수 있도록 모든 인덱싱 가능한 URL을 나열합니다. 반면, llms.txt는 커뮤니티 제안으로, 사람이 읽을 수 있는 Markdown 형식으로 웹사이트의 주요 내용을 설명합니다. sitemap.xml은 명확한 공식적인 용도를 가지고 있지만, llms.txt는 현재 플랫폼에서 사용을 약속하지 않고 있습니다. 두 가지는 서로 대체될 수 없습니다.
LLM-full.txt 파일이 반드시 필요한가요?
그렇지 않을 수도 있습니다. `llms-full.txt`는 용량을 조절할 수 있는 웹사이트에 적합한, 전체 콘텐츠 버전입니다. 페이지 수가 많은 웹사이트의 경우, 전체 콘텐츠를 펼쳐놓으면 오히려 핵심 내용을 희석시킬 수 있습니다. 본 웹사이트에서는 `llms.txt`에는 구조화된 목록을, `llms-full.txt`에는 서비스 및 사례에 대한 전체 내용을 담고 있습니다.
LLMs.txt 파일이 AI의 인용에 영향을 미칠 수 있나요?
현재 각 플랫폼의 공개된 문서에 따르면, Google은 명확히 사용하지 않고 있으며, 다른 플랫폼에서도 필수 조건으로 규정하지 않고 있습니다. 따라서, 중요한 것은 콘텐츠가 검색 엔진에 의해 수집될 수 있는지, 그리고 신뢰할 수 있는 출처인지 여부입니다. 이를 단순히 참고 자료로 활용하면 되지만, 필수적으로 요구하는 요소로 간주해서는 안 됩니다.