30초 핵심 요약

  • robots.txt는 AI 크롤러가 가장 먼저 읽는 파일입니다. 잘못된 설정은 ChatGPT, Claude, Perplexity에서 귀사를 보이지 않게 만들 수 있습니다
  • 최적 전략: 검색용 AI 크롤러(GPTBot, ClaudeBot, PerplexityBot)는 허용하고 학습용 크롤러(CCBot, Google-Extended)는 차단합니다
  • 지나치게 제한적인 WAF(Cloudflare Bot Fight Mode)는 완벽한 robots.txt가 있어도 AI 크롤러를 차단할 수 있습니다
  • AI Labs Audit은 각 AI 크롤러의 실제 사이트 접근을 자동으로 테스트합니다

robots.txt 파일은 AI 크롤러가 귀사 사이트를 방문할 때 가장 먼저 읽는 것입니다. 잘못된 설정은 ChatGPT, Claude, Perplexity에서 귀사를 완전히 보이지 않게 만들거나, 반대로 가시성 측면에서 아무런 대가 없이 모든 콘텐츠를 학습용 크롤러에 제공할 수 있습니다. AI를 위한 robots.txt 최적 설정 방법을 안내합니다.

두 가지 유형의 AI 크롤러 이해하기

모든 AI 크롤러가 동일하지는 않습니다. 목적이 매우 다른 두 가지 범주를 구분하는 것이 필수적입니다:

검색용 AI 크롤러 (허용 권장)

이 크롤러들은 실시간으로 사용자 질문에 답변하기 위해 귀사의 콘텐츠를 색인합니다. 이들을 허용하면 AI가 답변에서 귀사 사이트를 출처로 인용할 수 있어 페이지로 트래픽이 유입됩니다.

크롤러제공사용도
GPTBotOpenAIChatGPT 및 플러그인용 웹 검색
ClaudeBotAnthropicClaude용 웹 검색
PerplexityBotPerplexity AIPerplexity Search용 실시간 색인
CohereBotCohereCohere 애플리케이션용 검색
YouBotYou.comYou.com AI 검색 엔진

학습용 크롤러 (차단 권장)

이 크롤러들은 언어 모델 학습을 위해 귀사의 콘텐츠를 수집합니다. 이들을 차단해도 실시간 답변에 영향을 주지 않으므로 가시성이 감소하지 않으며, 지적 재산을 보호합니다.

크롤러제공사용도
CCBotCommon Crawl다수의 LLM이 사용하는 오픈소스 학습 데이터셋
Google-ExtendedGoogleGemini 모델 학습
GPTBot-TrainingOpenAI학습 데이터 수집 (검색과 별개)
FacebookBotMetaLlama 모델 학습
BytespiderByteDanceTikTok/Douyin 학습 및 색인

최적 robots.txt 설정

검색용 AI에서 가시성을 극대화하면서 학습 용도의 콘텐츠 사용으로부터 보호하는 권장 설정입니다:

# === 검색용 AI 크롤러: 허용 ===
# 이 크롤러들은 AI 답변에서 귀사 사이트를 인용합니다

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: CohereBot
Allow: /

User-agent: YouBot
Allow: /

# === 학습용 크롤러: 차단 ===
# 이 크롤러들은 대가 없이 데이터를 수집합니다

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: GPTBot-Training
Disallow: /

User-agent: FacebookBot
Disallow: /

User-agent: Bytespider
Disallow: /

가장 흔한 오류들

오류 1: 모든 AI 봇 차단

User-agent: * 규칙 다음에 Disallow: /를 사용하면 검색용과 학습용 크롤러를 무차별적으로 차단합니다. 결과: 귀사 사이트가 검색용 AI에서 보이지 않게 됩니다. 일부 기업은 가시성에 미치는 영향을 인식하지 못한 채 예방 차원에서 이 규칙을 추가합니다.

오류 2: robots.txt가 전혀 없는 경우

robots.txt가 없는 것이 모든 것을 차단하는 것보다는 낫지만, 제어권을 잃게 됩니다: 학습용 크롤러가 자유롭게 콘텐츠를 수집할 수 있습니다.

오류 3: 학습을 차단한다고 생각하며 GPTBot 차단

GPTBot은 학습이 아닌 ChatGPT의 웹 검색에 사용됩니다. 이를 차단하면 ChatGPT가 웹 검색 답변에서 귀사 사이트를 인용할 수 없게 됩니다.

WAF 및 Cloudflare의 함정

완벽하게 설정된 robots.txt가 있어도, WAF(Web Application Firewall)가 AI 크롤러를 차단하면 귀사 사이트가 AI에 보이지 않을 수 있습니다:

  • Cloudflare Bot Fight Mode: 이 기능은 GPTBot과 ClaudeBot을 포함한 자동화된 봇을 공격적으로 차단합니다. 이를 활성화하면 크롤러가 robots.txt에 도달하지 못하므로 설정이 무시됩니다
  • 지나치게 제한적인 WAF 규칙: user-agent나 행동 기반 규칙이 정당한 AI 크롤러를 차단할 수 있습니다
  • Rate limiting: 너무 낮은 요청 제한은 크롤러가 충분한 페이지를 색인하지 못하게 할 수 있습니다

해결책: 허용하려는 검색용 AI 크롤러의 user-agent에 대해 WAF에 예외를 추가하십시오.

AI Labs Audit을 통한 자동 검증

AI Labs Audit의 GEO 체크리스트는 단순히 robots.txt를 읽는 것에 그치지 않습니다. 각 AI 크롤러의 실제 사이트 접근을 테스트합니다:

  • robots.txt 테스트: 각 AI user-agent(GPTBot, ClaudeBot, PerplexityBot)에 대한 규칙 검증
  • SSR 테스트: 각 user-agent로 실제 접근을 시뮬레이션하여 WAF가 차단하지 않는지 확인
  • 검색/학습 구분: 보고서는 허용해야 할 크롤러와 차단할 수 있는 크롤러를 명확히 구분합니다
  • 실행 가능한 권장사항: 문제가 감지되면 보고서는 적용할 정확한 robots.txt 설정을 제공합니다

더 나아가기: llms.txt 및 메타 태그

robots.txt는 AI 접근성 전략의 한 요소일 뿐입니다. 두 가지 보완적 메커니즘이 주목할 가치가 있습니다:

  • llms.txt: 사이트 루트에 배치하여 AI에게 기업, 제품, 주요 페이지의 구조화된 요약을 제공하는 파일입니다. AI를 위한 브리핑과 같습니다 (현재까지 입증된 영향은 없음)
  • Meta tags noai: <meta name="robots" content="noai"> 지시문을 페이지별로 배치하여 전체 사이트를 차단하지 않고 특정 페이지를 AI 사용에서 제외할 수 있습니다. 민감한 페이지에 유용합니다

AI가 귀사 사이트에 접근할 수 있는지 확인하십시오

GEO 체크리스트 시작하기