기술 GEO

llms.txt란 무엇이고, 지금 만들 가치가 있을까

llms.txt는 AI가 사이트를 빠르게 이해하도록 돕는 마크다운 안내 파일입니다. 형식과 한국어 예시, llms-full.txt와의 차이, 구글·OpenAI·Anthropic의 공식 입장까지 2026년 9월 기준으로 정리했습니다.

업데이트 읽는 시간 약 12분
llms.txt란 무엇이고, 지금 만들 가치가 있을까 — 개념 일러스트
이 글의 목차
  1. llms.txt란 무엇이고 누가 만들었나요?
  2. llms.txt는 어떤 형식으로 작성하나요?
  3. llms-full.txt와 페이지별 .md 파일은 무엇이 다른가요?
  4. robots.txt, sitemap.xml과는 무엇이 다른가요?
  5. 구글·OpenAI·Anthropic은 llms.txt를 읽나요?
  6. 지금 만들 가치가 있을까요?
  7. 어떻게 유지 관리하고, 무엇을 피해야 하나요?
  8. 자주 묻는 질문
  9. 참고 자료

핵심 답변

llms.txt는 사이트 루트(/llms.txt)에 두는 마크다운 파일로, AI 모델과 에이전트가 사이트의 핵심 정보와 주요 문서 링크를 빠르게 찾도록 정리한 안내서입니다. 2024년 9월 제러미 하워드(Answer.AI)가 제안한 커뮤니티 규격이며, 구글은 2026년 6월 공식 문서에서 구글 검색은 이 파일을 사용하지 않고 순위에도 영향이 없다고 밝혔습니다.

“llms.txt만 올리면 ChatGPT에 나온다”는 말이 많지만, 공식 문서로 확인되는 사실은 훨씬 제한적입니다. 이 글은 형식과 작성법을 실무 예시로 보여 드리고, 어떤 회사가 무엇을 공식적으로 밝혔는지 출처와 함께 구분해 정리합니다.

llms.txt란 무엇이고 누가 만들었나요?

llms.txt는 대규모 언어 모델(LLM)이 읽기 좋은 형태로 사이트를 요약하고, 더 자세한 문서의 위치를 알려 주는 파일입니다. Answer.AI 공동 창업자 제러미 하워드(Jeremy Howard)가 2024년 9월 3일 제안했습니다(Answer.AI, 2024). 제안 배경은 두 가지입니다. HTML 페이지는 메뉴·광고·자바스크립트에 싸여 있어 깨끗한 텍스트로 바꾸기 어렵고, 사이트 전체를 한 번에 넣기에는 AI의 컨텍스트 창(한 번에 읽을 수 있는 분량)이 여전히 작다는 점입니다(llmstxt.org, 2026).

2026년 8월에는 2년간의 사용 경험을 반영한 v2가 나왔습니다. 제안자는 수천 개 사이트가 이 파일을 게시하고, 문서 플랫폼이 자동으로 만들어 준다고 설명합니다(llmstxt.org, 2026). 다만 IETF나 W3C 같은 표준 기구의 표준이 아니라, GitHub에서 의견을 받는 공개 제안이라는 점은 기억해야 합니다.

llms.txt는 어떤 형식으로 작성하나요?

정해진 순서의 마크다운 구조를 따릅니다. 사람이 읽을 수 있으면서도 프로그램이 파싱할 수 있게 하려는 설계입니다(llmstxt.org, 2026).

  1. H1 제목: 사이트 또는 프로젝트 이름. 유일한 필수 항목입니다.
  2. 인용문(>) 요약: 나머지 내용을 이해하는 데 필요한 핵심 정보를 짧게 씁니다.
  3. 세부 설명: 문단이나 목록으로 쓰며, 제목(heading)은 쓰지 않습니다.
  4. H2 섹션별 링크 목록: - [이름](URL): 설명 형식입니다.
  5. Optional 섹션: 짧은 맥락이 필요할 때 건너뛰어도 되는 보조 링크를 모으는 관례입니다. v2부터는 도구가 기계적으로 제외하는 의미가 사라지고 관례로만 남았습니다(llmstxt.org, 2026).

아래는 가상의 B2B 제조사를 기준으로 쓴 한국어 예시입니다. 회사 소개 사이트라면 이 정도 분량이면 충분합니다.

llms.txt
# 예시정밀 (Example Precision)

> 예시정밀은 경기도 시흥에 공장을 둔 산업용 정밀 금속 가공 부품 제조사입니다. 반도체·2차전지 장비용 부품을 소량 다품종으로 생산하며, 국내외 B2B 고객만 거래합니다.

핵심 사실:
- 설립 2012년, 임직원 48명, ISO 9001 인증
- 최소 주문 수량: 시제품 1개부터, 양산 견적은 도면 기준 3영업일 내 회신
- 문의: [email protected] · https://www.example.co.kr/contact

## 제품·서비스
- [CNC 정밀 가공](https://www.example.co.kr/services/cnc.md): 가공 가능 소재, 공차, 최대 크기
- [표면 처리](https://www.example.co.kr/services/finishing.md): 아노다이징·무전해 니켈 도금 사양

## 구매 안내
- [견적 절차와 납기](https://www.example.co.kr/guide/quote.md): 도면 형식, 견적 기준, 평균 납기
- [품질 보증 정책](https://www.example.co.kr/guide/quality.md): 검사 성적서, 불량 처리 기준

## Optional
- [회사 연혁](https://www.example.co.kr/about/history.md)
- [채용 안내](https://www.example.co.kr/careers.md)

v2에서는 파일 위치 규칙도 명확해졌습니다. 루트뿐 아니라 /docs/llms.txt처럼 하위 경로에도 둘 수 있고, 그 파일은 해당 경로 아래 페이지를 설명합니다. 여러 파일이 겹치면 가장 구체적인 경로의 파일을 씁니다(llmstxt.org, 2026).

llms-full.txt와 페이지별 .md 파일은 무엇이 다른가요?

llms-full.txt는 사이트 본문 전체를 한 파일로 합친 것이고, llms.txt는 목차와 요약만 담은 파일입니다. llms-full.txt는 llmstxt.org 제안서에 정의된 파일이 아닙니다. 문서 플랫폼 Mintlify가 2024년 11월 llms.txt와 함께 자동 생성하기 시작하면서 널리 퍼진 관례입니다(Mintlify, 2024). 코딩 도우미에 문서 전체를 한 번에 넣을 때 편리하지만, 규모가 큰 사이트에서는 파일이 지나치게 커집니다. 2026년 9월 28일 저희가 확인한 Cloudflare 개발자 문서의 llms-full.txt는 약 60MB였습니다.

제안서가 실제로 권하는 방식은 페이지별 마크다운 버전입니다. 원래 URL 뒤에 .md를 붙이거나(page.html.md) 확장자를 바꾼(page.md) 주소로 같은 내용을 깨끗한 마크다운으로 제공합니다. 파일명이 없는 URL은 index.html.md나 index.md를 씁니다. v2는 AI가 이 파일들을 추측하지 않고 찾도록 표준 링크 관계도 권장합니다(llmstxt.org, 2026).

HTML head 또는 HTTP 응답 헤더
<link rel="alternate" type="text/markdown" href="/guide/quote.md">
<link rel="describedby" href="/llms.txt">

Link: </guide/quote.md>; rel="alternate"; type="text/markdown", </llms.txt>; rel="describedby"

robots.txt, sitemap.xml과는 무엇이 다른가요?

세 파일은 모두 루트에 두는 약속된 파일이지만 역할이 전혀 다릅니다. 특히 llms.txt에는 접근을 막거나 허용하는 기능이 없습니다.

구분robots.txtsitemap.xmlllms.txt
목적크롤러의 접근 허용·제한색인할 URL 목록 제공AI가 읽을 핵심 정보와 링크 요약
형식User-agent·Allow·Disallow 규칙XML마크다운
표준화IETF RFC 9309(2022)sitemaps.org 프로토콜커뮤니티 제안(v2, 2026)
범위경로별 규칙파일당 최대 5만 개 URL·50MB선별한 핵심 링크, 외부 링크 가능
강제력없음. 접근 권한 통제가 아님없음. 크롤링 힌트없음. 읽을지는 AI 도구가 결정
쓰이는 시점크롤링 전크롤링·색인주로 답변을 만드는 추론 시점

RFC 9309는 robots.txt 규칙이 접근 권한 통제가 아니라고 명시합니다(IETF, 2022). sitemap.xml은 파일당 5만 개 URL·50MB 제한이 있는 전체 목록입니다(sitemaps.org). llms.txt는 제안자가 밝힌 대로 학습보다 필요할 때 꺼내 읽는 용도로 쓰여 왔습니다(llmstxt.org, 2026). AI 크롤러의 접근을 정하는 방법은 AI 크롤러 robots.txt 설정 가이드에서 따로 다룹니다.

구글·OpenAI·Anthropic은 llms.txt를 읽나요?

2026년 9월 기준, 자사 검색이나 크롤러가 웹사이트의 llms.txt를 읽는다고 공식 문서로 밝힌 주요 AI 검색 기업은 확인되지 않습니다. 구글은 반대로 사용하지 않는다고 명시했습니다.

주체공식 입장(2026년 9월 기준)
구글 검색AI 기능을 포함한 구글 검색은 llms.txt를 사용하지 않으며, 만들어도 노출·순위에 도움도 해도 되지 않음. 다른 서비스를 위해 유지하는 것은 무방(2026년 6월 15일 문서 추가)
Chrome Lighthouse‘에이전트 브라우징’ 점검 항목에 llms.txt 포함. 파일이 없으면(404) 해당 없음(N/A), 서버 오류가 나면 문제로 표시
OpenAI·Anthropic·Perplexity자사 개발자 문서에는 llms.txt를 게시. 그러나 공식 크롤러 문서는 robots.txt만 다루고, 웹사이트의 llms.txt를 읽는다는 언급은 없음

구글의 생성형 AI 최적화 가이드는 AI 기능에 노출되려고 새로운 기계 판독용 파일이나 AI 텍스트 파일, 마크다운을 만들 필요가 없다고 설명합니다(Google Search Central, 2026). 한편 같은 구글 계열인 Chrome의 Lighthouse는 이 파일을 점검합니다. 파일이 없으면 ‘해당 없음’으로 처리하고, 서버 오류가 날 때만 문제로 표시합니다(Chrome for Developers, 2026). 즉 검색 순위 요소가 아니라 AI 에이전트를 위한 선택 사항으로 다뤄집니다.

OpenAI·Anthropic·Perplexity가 각자 개발자 문서에 llms.txt를 두고 있다는 사실은 “게시”이지, 크롤러가 여러분의 파일을 읽는다는 발표가 아닙니다. 세 회사의 크롤러 문서에는 robots.txt 설정 방법만 있습니다(OpenAI, 2026; Anthropic, 2026; Perplexity, 2026). 제안자 역시 가장 활발한 사용처로 코딩 에이전트가 API 문서를 찾아 읽는 경우를 꼽습니다(llmstxt.org, 2026).

정리하면

llms.txt는 순위 요소가 아닙니다. AI 도구가 사이트를 요약할 때 참고할 수 있는 정확한 원본을 하나 더 두는 일이며, 효과는 그 도구가 파일을 실제로 읽을 때만 생깁니다.

지금 만들 가치가 있을까요?

빌드 과정에서 자동으로 만들 수 있다면 비용이 거의 들지 않으므로 만들어 두는 편이 낫습니다. 반대로 사람이 손으로 관리해야 한다면 우선순위는 낮습니다. 가격·사양이 바뀌었는데 파일이 그대로면 AI에게 틀린 정보를 주는 셈이기 때문입니다.

먼저 만들면 좋은 경우

  • API·SaaS·개발 도구처럼 문서가 많고, 코딩 에이전트가 문서를 읽는 제품
  • 사양·납기·가격 정책이 복잡해 AI가 잘못 요약하기 쉬운 B2B 사이트
  • CMS나 빌드 도구가 파일을 자동으로 생성·갱신해 주는 사이트

반대로 검색엔진에 제대로 수집되지 않거나, CDN 보안 설정이 AI 크롤러를 막고 있는 사이트라면 llms.txt보다 기본기가 먼저입니다. 크롤링 허용, 색인, 서버 응답, 질문에 바로 답하는 콘텐츠가 AI 인용의 출발점입니다. 기술 점검 순서는 기술적 SEO 가이드(PART 5)를, GEO 전체 그림은 GEO란 무엇인가를 참고하세요.

어떻게 유지 관리하고, 무엇을 피해야 하나요?

가장 좋은 방법은 사람이 따로 고치지 않도록 자동 생성하는 것입니다. 이 사이트는 빌드할 때마다 각 페이지의 제목·요약 메타데이터로 /llms.txt와 llms-full.txt를 새로 만들기 때문에, 페이지를 추가하거나 고치면 파일도 함께 바뀝니다. 사이트맵과 같은 원본을 쓰면 두 파일의 URL이 어긋날 일도 없습니다.

  • 정식 URL만 넣기: 리디렉션·404·noindex 페이지는 빼고, canonical URL을 씁니다.
  • 본문과 같은 사실 쓰기: 가격·수치가 페이지 본문과 다르면 AI가 어느 쪽을 믿을지 알 수 없습니다.
  • 정상 응답 확인: 200 상태 코드와 UTF-8 인코딩으로 응답하는지, 방화벽이나 CDN 봇 차단에 걸리지 않는지 확인합니다.
  • 에이전트로 시험하기: 제안서 권고대로 llms.txt만 준 상태에서 AI에게 질문해 원하는 답이 나오는지 봅니다(llmstxt.org, 2026).
  • 로그로 확인하기: 게시한 뒤 서버 로그에서 /llms.txt 요청의 User-Agent를 살펴보면 어떤 도구가 실제로 파일을 읽는지 알 수 있습니다. 공식적으로 확인된 효과 지표가 없는 만큼, 우리 사이트의 데이터를 직접 보는 것이 가장 정확합니다.

흔한 실수

llms.txt에 Disallow 같은 robots.txt 문법이나 “AI 학습 금지” 문구를 넣어도 아무 효력이 없습니다. 모든 URL을 나열해 사이트맵처럼 만들거나, 키워드와 홍보 문구를 반복하는 것도 파일의 목적인 간결한 안내와 맞지 않습니다.

자주 묻는 질문

llms.txt가 없으면 구글 AI 개요에 나오지 않나요?

아닙니다. 구글은 AI 개요와 AI 모드에 노출되는 데 추가 요건이 없으며, 색인되고 스니펫 표시가 가능한 페이지라면 노출 대상이 된다고 안내합니다. llms.txt는 구글 검색이 사용하지 않는 파일이라, 있어도 없어도 노출과 순위에 영향이 없습니다.

llms.txt와 robots.txt 중 무엇을 먼저 챙겨야 하나요?

robots.txt와 CDN 보안 설정이 먼저입니다. AI 검색 봇이 사이트에 접근하지 못하면 llms.txt도 읽을 수 없고 인용될 기회도 없습니다. 접근 설정을 확인한 뒤 llms.txt를 보조 수단으로 더하는 순서를 권합니다.

llms-full.txt도 꼭 만들어야 하나요?

필수가 아닙니다. llms-full.txt는 제안서에 정의된 파일이 아니라 문서 플랫폼에서 퍼진 관례입니다. 문서가 많은 개발 제품에는 유용하지만, 큰 사이트에서는 파일이 너무 커져 AI가 한 번에 읽기 어렵습니다.

워드프레스나 사이트 빌더에서도 만들 수 있나요?

llmstxt.org는 자동 생성 도구로 Yoast SEO·AIOSEO(워드프레스 플러그인), Wix, Mintlify, GitBook 등을 소개합니다. 사이트 루트에 파일을 올릴 수 없는 플랫폼도 있으니, 사용하는 플랫폼이 이를 지원하는지 먼저 확인하세요.

llms.txt로 AI 학습을 막을 수 있나요?

막을 수 없습니다. 학습 목적의 수집을 거부하려면 robots.txt에서 GPTBot, ClaudeBot, Google-Extended 같은 학습용 토큰을 차단해야 합니다. 이 역시 크롤러가 자발적으로 지키는 규칙이므로, 필요하면 CDN 차원의 차단을 함께 씁니다.

참고 자료

  1. The /llms.txt file, v2 — llmstxt.org (Jeremy Howard), 2024-09-03 제안 · 2026-08-10 개정
  2. Changes (v2, August 2026) — llmstxt.org, 2026-08
  3. /llms.txt—a proposal to provide information to help LLMs use websites — Answer.AI, 2024-09-03
  4. Optimizing your website for generative AI features on Google Search — Google Search Central, 2026-07-10
  5. Latest Google Search Documentation Updates (Clarifying guidance on llms.txt files) — Google Search Central, 2026-06-15
  6. AI features and your website — Google Search Central, 2025-12-10
  7. llms.txt (Lighthouse agentic browsing audit) — Chrome for Developers, 2026-05-05
  8. Overview of OpenAI Crawlers — OpenAI, 2026-09-28 확인
  9. Does Anthropic crawl data from the web, and how can site owners block the crawler? — Anthropic, 2026-04-07
  10. Perplexity Crawlers — Perplexity, 2026-09-28 확인
  11. Simplifying docs for AI with /llms.txt — Mintlify, 2024-11-20
  12. RFC 9309: Robots Exclusion Protocol — IETF, 2022-09
  13. Sitemaps XML format — sitemaps.org, 2026-09-28 확인