기술 GEO

AI 크롤러 robots.txt 설정 가이드: GPTBot·ClaudeBot·Google-Extended 허용과 차단

AI 크롤러는 학습용·검색용·사용자 요청용으로 나뉘고, 무엇을 막느냐에 따라 AI 답변에 인용될 가능성이 달라집니다. 공식 문서로 확인한 크롤러 표와 robots.txt 템플릿, Cloudflare의 2026년 9월 변경 사항까지 정리했습니다.

업데이트 읽는 시간 약 15분
AI 크롤러 robots.txt 설정 가이드: GPTBot·ClaudeBot·Google-Extended 허용과 차단 — 개념 일러스트
이 글의 목차
  1. AI 크롤러 설정이 GEO에 왜 중요한가요?
  2. 주요 AI 크롤러는 무엇이고 용도는 어떻게 다른가요?
  3. 바로 쓰는 robots.txt 템플릿 3종
  4. 진짜 AI 크롤러인지 어떻게 확인하나요?
  5. Cloudflare를 쓴다면 무엇을 확인해야 하나요?
  6. 우리 회사는 어떻게 설정해야 할까요?
  7. 자주 묻는 질문
  8. 참고 자료

핵심 답변

AI 크롤러는 학습용(GPTBot·ClaudeBot 등), 검색·색인용(OAI-SearchBot·Claude-SearchBot·PerplexityBot), 사용자 요청 시 방문하는 봇(ChatGPT-User 등)으로 나뉘며, robots.txt에서 토큰별로 따로 허용하거나 차단할 수 있습니다. AI 답변에 인용되려면 검색용 봇과 Googlebot은 열어 두고 학습 허용 여부만 고르는 것이 일반적이며, 구글 AI 개요는 Google-Extended가 아니라 Googlebot 설정의 영향을 받습니다.

내 사이트는 지금 어떻게 설정되어 있을까요?

뎁팀이 운영하는 GEOCheck 무료 진단에 주소를 넣으면 robots.txt가 GPTBot·OAI-SearchBot·ClaudeBot·PerplexityBot·Google-Extended 등 15개 AI·검색 크롤러를 허용하는지, 방화벽이 AI 봇을 막고 있지 않은지 바로 확인할 수 있습니다.

AI 크롤러 설정이 GEO에 왜 중요한가요?

AI 검색은 자사 크롤러로 수집한 문서를 근거로 답하기 때문에, 검색용 봇을 막으면 인용될 기회도 사라집니다. OpenAI는 OAI-SearchBot을 차단한 사이트가 ChatGPT 검색 답변에 표시되지 않고 탐색용 링크로만 나올 수 있다고 밝힙니다(OpenAI, 2026). Anthropic도 Claude-SearchBot이나 Claude-User를 막으면 검색 노출이 줄 수 있다고 안내합니다(Anthropic, 2026). 구글도 AI 기능을 위한 기본 관행으로 robots.txt와 CDN·호스팅 설정 모두에서 크롤링을 허용하라고 안내합니다(Google Search Central, 2025).

실제로 대부분의 사이트는 검색은 열고 학습만 선택적으로 막습니다. Cloudflare를 쓰는 사이트 중 검색 봇을 차단하는 곳은 1% 미만이지만, 학습 차단 수단을 켠 곳은 17%입니다(Cloudflare, 2026).

주요 AI 크롤러는 무엇이고 용도는 어떻게 다른가요?

아래 표는 2026년 9월 28일 각 회사 공식 문서를 기준으로 정리했습니다. 회사명을 누르면 공식 문서로 이동합니다. ‘사용자 요청’ 봇은 사람이 AI에게 질문했을 때 특정 페이지를 가져오는 봇으로, 여러 회사가 robots.txt가 적용되지 않을 수 있다고 밝힙니다.

회사robots.txt 토큰용도robots.txt 준수(공식 표현)
OpenAIGPTBotAI 모델 학습robots.txt로 관리
OAI-SearchBotChatGPT 검색 노출robots.txt로 관리(반영 약 24시간)
ChatGPT-User사용자 요청적용되지 않을 수 있음
AnthropicClaudeBotAI 모델 학습준수, Crawl-delay 지원
Claude-SearchBot검색 품질·색인준수
Claude-User사용자 요청준수
PerplexityPerplexityBot검색 노출(학습에 쓰지 않음)robots.txt로 관리
Perplexity-User사용자 요청대체로 무시
GoogleGooglebot검색 전체(AI 개요·AI 모드 포함)준수
Google-ExtendedGemini 학습·Gemini 앱 그라운딩 제어별도 크롤러 없음(제어용 토큰)
AppleApplebotSpotlight·Siri·Safari 검색 등준수
Applebot-Extended파운데이션 모델 학습 제어크롤링하지 않음(제어용 토큰)
Metameta-externalagentAI 모델 학습·제품용 색인robots.txt로 관리
meta-webindexerMeta AI 검색 품질robots.txt로 관리
meta-externalfetcher사용자 요청우회할 수 있음
AmazonAmazonbot제품 개선, AI 학습에 쓰일 수 있음준수
Amzn-SearchBot알렉사 등 검색(학습에 쓰지 않음)준수
Amzn-User사용자 요청일부 따르지 않을 수 있음
Common CrawlCCBot누구나 분석할 수 있는 공개 웹 데이터셋준수
ByteDanceBytespider운영사 공식 문서 확인 불가확인 불가
네이버Yeti네이버 검색준수
다음DaumDaum 웹문서 검색준수

표에서 놓치기 쉬운 사실이 몇 가지 있습니다.

  • Google-Extended는 검색과 무관합니다. 구글 검색 노출이나 순위에 영향을 주지 않으며, Gemini 모델 학습과 Gemini 앱·Vertex AI의 그라운딩(답변 생성 시 검색 색인 내용 제공)만 제어합니다(Google, 2026). AI 개요와 AI 모드는 Googlebot 설정을 따르고, 노출 범위는 nosnippet·data-nosnippet·max-snippet·noindex로 조절합니다(Google Search Central, 2025).
  • Applebot은 Googlebot 규칙을 따를 수 있습니다. robots.txt가 Applebot은 언급하지 않고 Googlebot만 언급하면 Applebot은 Googlebot 규칙을 따릅니다. Applebot이 수집한 데이터는 학습에도 쓰일 수 있어 학습 거부는 Applebot-Extended로, Siri·검색의 AI 답변 제외는 nosnippet으로 합니다(Apple, 2026).
  • 옛 토큰을 점검하세요. 많은 템플릿에 있는 anthropic-ai, Claude-Web은 Anthropic의 현재 문서에 없습니다(Anthropic, 2026). 다음 고객센터는 수집 로봇 이름을 Daum(User-Agent Daum/4.1)으로 안내하며(Daum, 2026), 흔히 쓰는 Daumoa는 2007년 발표된 옛 이름입니다(카카오, 2007).
  • Bytespider는 운영사 문서를 확인할 수 없습니다. Cloudflare는 2024년 자사 네트워크에서 요청 수가 가장 많은 AI 크롤러로 Bytespider를 꼽았고, 관리형 robots.txt의 차단 목록에도 넣고 있습니다(Cloudflare, 2024; Cloudflare, 2026). robots.txt만으로 통제된다고 가정하지 않는 편이 안전합니다.

바로 쓰는 robots.txt 템플릿 3종

작성 전에 한 가지 규칙을 알아야 합니다. 크롤러는 자기 이름과 일치하는 그룹이 있으면 그 그룹만 따르고, 일치하는 그룹이 없을 때만 User-agent: * 그룹을 따릅니다(IETF, 2022). 그래서 특정 봇 그룹을 만들면 /admin/ 같은 공통 차단 경로를 그 그룹에도 다시 적어야 합니다. 여러 User-agent 줄을 한 그룹으로 묶을 수 있고, 이름은 대소문자를 구분하지 않습니다.

템플릿 1 · 모두 허용 (AI 인용 극대화)
# 검색엔진과 AI 크롤러를 모두 허용
User-agent: *
Allow: /
Disallow: /admin/

Sitemap: https://www.example.com/sitemap.xml
템플릿 2 · 검색·답변은 허용, 학습용 수집은 거부
# 학습 목적 크롤러·토큰 차단
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: CCBot
User-agent: Bytespider
Disallow: /

# 그 밖의 크롤러(Googlebot, OAI-SearchBot, Claude-SearchBot, PerplexityBot, Yeti 등)는 허용
User-agent: *
Allow: /
Disallow: /admin/

Sitemap: https://www.example.com/sitemap.xml
템플릿 3 · AI 크롤러 전면 차단 (일반 검색엔진은 유지)
# AI 학습·검색·사용자 요청 봇 차단
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: Amazonbot
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: CCBot
User-agent: Bytespider
Disallow: /

# Googlebot, Bingbot, Applebot, Yeti, Daum 등 일반 검색은 허용
User-agent: *
Allow: /
Disallow: /admin/

Sitemap: https://www.example.com/sitemap.xml

템플릿별 주의 사항

템플릿 2에서 Google-Extended를 막으면 학습뿐 아니라 Gemini 앱의 그라운딩에도 쓰이지 않습니다. Amazonbot과 meta-externalagent는 학습 외 제품 개선에도 쓰입니다. 템플릿 3을 써도 구글 AI 개요·AI 모드 노출은 막히지 않으며, 막으려면 nosnippet 등을 써야 해 일반 검색 스니펫도 함께 줄어듭니다. 두 템플릿 모두 목록에 없는 새 봇과 robots.txt를 따르지 않는 사용자 요청 봇에는 효과가 없습니다.

진짜 AI 크롤러인지 어떻게 확인하나요?

User-Agent 문자열은 누구나 흉내 낼 수 있으므로 IP로 확인해야 합니다(Google, 2026). 방법은 두 가지입니다.

  1. 역방향·정방향 DNS 조회: 접속 IP의 호스트 이름을 조회해 공식 도메인인지 보고, 그 호스트 이름을 다시 조회해 원래 IP와 같은지 확인합니다. 구글·Apple·네이버·Common Crawl이 이 방식을 안내하며, 예시는 아래 코드와 같습니다.
  2. 공개 IP 목록 대조: OpenAI·Perplexity는 봇마다 IP 목록 파일을 따로 공개하고, Anthropic·구글·Apple·Amazon·네이버·Common Crawl도 크롤러 IP 대역을 공개합니다. 목록은 예고 없이 바뀌므로 한 번 복사해 두지 말고 주기적으로 새로 받아 대조하세요.
Bash · 로그 집계와 봇 검증
# 1) Nginx 접근 로그에서 크롤러별 요청 수 집계
grep -oE "GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-SearchBot|Claude-User|PerplexityBot|Perplexity-User|Applebot|meta-externalagent|Amazonbot|CCBot|Bytespider|Yeti|Daum" /var/log/nginx/access.log | sort | uniq -c | sort -rn

# 2) 역방향 조회 → 정방향 조회 결과가 원래 IP와 같으면 진짜 봇 (구글 문서 예시)
host 66.249.66.1
host crawl-66-249-66-1.googlebot.com

# 네이버 Yeti (서치어드바이저 예시)
host 125.209.235.169
host crawl.125-209-235-169.web.naver.com

Cloudflare를 거치는 사이트는 원 서버 로그에 Cloudflare IP가 찍힐 수 있으니, 방문자 IP를 담은 CF-Connecting-IP 헤더를 로그에 남기세요(Cloudflare, 2026). 구글은 서명으로 봇을 인증하는 Web Bot Auth도 시험하고 있습니다(Google, 2026).

Cloudflare를 쓴다면 무엇을 확인해야 하나요?

Cloudflare 사이트는 robots.txt와 별개로 CDN 단계에서 AI 봇이 차단될 수 있습니다. Cloudflare는 2024년 7월 무료 플랜을 포함한 모든 고객에게 AI 봇 원클릭 차단을 제공했고(Cloudflare, 2024), 2025년 7월 1일에는 새로 등록하는 모든 도메인에 AI 크롤러 허용 여부를 묻고 기본값을 차단 쪽으로 바꿨습니다(Cloudflare, 2025). 관리형 robots.txt를 켜면 원래 파일 앞에 학습 크롤러 차단 규칙을 덧붙여 제공합니다(Cloudflare, 2026).

2026년 9월 15일에는 설정 체계가 크게 바뀌었습니다(Cloudflare, 2026).

  • AI 봇 정책이 검색(Search)·학습(Training)·에이전트(Agent) 세 항목으로 나뉘었습니다.
  • 학습 항목에 새 옵션 ‘Disallow AI Training’이 생겼습니다. GPTBot·ClaudeBot 같은 학습 전용 크롤러는 차단하고, 검색을 겸하는 Googlebot 등은 검색용으로 계속 허용하면서 학습 거부 의사를 robots.txt로 알립니다.
  • 학습 항목의 Block과 ‘광고 페이지에서만 차단’은 이제 Googlebot·Bingbot·Applebot 같은 겸용 크롤러에도 적용되어 검색에도 영향을 줍니다.
  • 기존 ‘Block AI bots’ 설정은 폐지 예정이고, 관리형 robots.txt는 Bot Preference Sync로 대체됩니다. 기존 설정은 자동으로 이전됩니다.

Cloudflare 점검 순서

  • Security → Settings에서 AI 봇 정책(Configure AI bot policies)을 확인합니다. AI 인용이 목표라면 검색은 Allow, 학습은 Allow 또는 Disallow AI Training을 고르고 Block은 피합니다.
  • AI Crawl Control의 Crawlers 표에서 크롤러별 요청 수와 robots.txt 위반 횟수를 보고 봇마다 허용·차단을 정합니다. 모든 플랜에서 쓸 수 있고, 무료 플랜은 User-Agent 기준으로만 식별합니다.
  • 브라우저로 https://내-도메인/robots.txt를 직접 열어, Cloudflare가 덧붙인 규칙이 의도와 맞는지 확인합니다.
  • Security → Analytics의 Events 탭에서 Googlebot·Yeti·OAI-SearchBot이 차단되거나 챌린지를 받는지 봅니다. 무료 플랜의 Bot Fight Mode는 WAF 사용자 규칙으로 예외를 만들 수 없으니, 필요한 봇을 막는다면 기능을 끄는 것까지 검토해야 합니다.

우리 회사는 어떻게 설정해야 할까요?

B2B 서비스·제조·SaaS처럼 AI 추천이 영업 기회로 이어지는 회사라면 템플릿 1이나 2가 맞습니다. 콘텐츠 자체가 상품인 유료 매체·데이터 사업자는 템플릿 2나 3을 검토하되, 차단할수록 AI 답변에서 빠진다는 비용을 함께 따져야 합니다. 국내 사이트라면 설정을 바꾼 뒤 네이버 서치어드바이저의 robots.txt 검증 도구로 Yeti가 함께 막히지 않았는지 꼭 확인하세요. 네이버 수집이 막히면 네이버 검색 노출 전체가 흔들립니다.

결정 체크리스트

  • ChatGPT·Claude·Perplexity 답변에 인용되는 것이 목표인가? 그렇다면 OAI-SearchBot·Claude-SearchBot·PerplexityBot은 반드시 허용합니다.
  • AI 학습에 쓰이는 것을 거부해야 할 법적·사업적 이유가 있는가? 없다면 학습 봇까지 허용해도 됩니다.
  • Google-Extended를 막을 때 Gemini 앱 그라운딩 제외를 감수할 수 있는가?
  • 네이버 Yeti와 다음 Daum 봇이 실수로 막혀 있지 않은가?
  • robots.txt와 CDN·방화벽 설정이 같은 방향을 가리키는가?
  • 분기마다 로그와 각 회사 공식 문서를 다시 확인할 담당자가 있는가? 새 봇과 이름 변경이 계속 나옵니다.

AI 크롤러 설정은 기술적 SEO의 일부입니다. 크롤링·색인 전반은 기술적 SEO 가이드(PART 5), AI용 안내 파일은 llms.txt 가이드, 전략의 큰 그림은 GEO란 무엇인가에서 이어서 볼 수 있습니다. 설정과 서버·CDN 수정을 함께 맡기려면 테크니컬 SEO 서비스를 참고하세요.

자주 묻는 질문

GPTBot을 차단하면 ChatGPT 검색에 안 나오나요?

아닙니다. OpenAI는 학습용 GPTBot과 검색용 OAI-SearchBot을 독립적으로 설정할 수 있다고 밝힙니다. GPTBot만 막고 OAI-SearchBot을 허용하면 학습에는 쓰이지 않으면서 ChatGPT 검색 결과에는 나올 수 있습니다.

Google-Extended를 차단하면 AI 개요에서 빠지나요?

빠지지 않습니다. 구글 AI 개요와 AI 모드는 Googlebot의 크롤링을 따르며, Google-Extended는 Gemini 학습과 Gemini 앱 등의 그라운딩만 제어합니다. AI 개요에 쓰이는 범위를 줄이려면 nosnippet 같은 스니펫 제어를 써야 하고, 이는 일반 검색 결과에도 적용됩니다.

robots.txt만으로 AI 크롤러를 확실히 막을 수 있나요?

확실하지 않습니다. RFC 9309는 robots.txt가 접근 권한 통제가 아니라고 명시하며, ChatGPT-User·Perplexity-User처럼 사용자 요청 봇은 규칙이 적용되지 않을 수 있습니다. 반드시 막아야 한다면 IP 검증을 거친 CDN·방화벽 차단을 함께 씁니다.

네이버와 다음 크롤러도 따로 설정해야 하나요?

User-agent: * 그룹에서 모두 허용하고 있다면 따로 적을 필요는 없습니다. 다만 특정 봇 그룹을 만들 때 Yeti나 Daum이 차단 목록에 섞이지 않았는지, 방화벽이 네이버 IP 대역을 막고 있지 않은지 확인하세요.

Cloudflare에서 예전에 AI 봇 차단을 켰는데 괜찮을까요?

Cloudflare는 2026년 9월 15일 변경에 맞춰 기존 설정을 새 체계로 자동 이전하며, 대부분 추가 조치가 필요 없다고 설명합니다. 다만 이후 학습 항목에서 Block을 고르면 Googlebot까지 막히므로, 설정 화면과 실제 robots.txt를 한 번 확인하는 것이 안전합니다.

참고 자료

  1. Overview of OpenAI Crawlers — OpenAI, 2026-09-28 확인
  2. Anthropic 웹 크롤러 안내(고객센터) — Anthropic, 2026-04-07
  3. Perplexity Crawlers — Perplexity, 2026-09-28 확인
  4. Google's common crawlers (Google-Extended) — Google, 2026-07-14
  5. Google's user-triggered fetchers — Google, 2026-08-19
  6. Verify requests from Google crawlers and fetchers — Google, 2026-03-20
  7. AI features and your website — Google Search Central, 2025-12-10
  8. About Applebot — Apple, 2026-09-04
  9. Meta Web Crawlers — Meta, 2026-09-28 확인
  10. About Amazonbot — Amazon, 2026-09-28 확인
  11. CCBot — Common Crawl, 2026-09-28 확인
  12. robots.txt 설정하기 · 검색로봇 확인 방법 — 네이버 서치어드바이저, 2026-09-28 확인
  13. Daum 웹문서 검색이란 — Daum 고객센터, 2026-09-28 확인
  14. 다음, 검색엔진 자체 개발로 검색서비스 경쟁력 배가 — 카카오(당시 다음커뮤니케이션), 2007-05-14
  15. RFC 9309: Robots Exclusion Protocol — IETF, 2022-09
  16. Declare your AIndependence — Cloudflare, 2024-07-03
  17. AI 크롤러 기본 차단 전환 보도자료 — Cloudflare, 2025-07-01
  18. Have it both ways(Disallow AI Training 발표) — Cloudflare, 2026-09-15
  19. robots.txt setting · Manage AI crawlers · Bot Fight Mode · HTTP headers — Cloudflare Docs, 2026-07~08