본문 바로가기
SEO·GEO 용어사전

AI 크롤러 (AI Crawler)

마지막 업데이트

AI 크롤러는 AI 모델 학습, 검색 색인, 사용자 요청 처리와 안전성 확인 등을 위해 웹페이지에 접근하는 자동화된 봇입니다. 학습용, 검색 색인용, 사용자 요청용은 목적이 서로 다르며, 한 회사도 역할별로 여러 봇을 운영할 수 있습니다. 구글봇처럼 기존 검색 크롤러가 AI 검색 기능의 자료 수집에도 쓰이는 경우가 있어, 전통적인 검색 크롤러와 언제나 별개라고 볼 수는 없습니다.

이 글은 각 AI 플랫폼의 공식 문서를 기준으로 작성했습니다.

목적별 봇의 구분

같은 회사도 학습용, 실시간 방문용, 검색 인덱싱용 봇을 따로 운영합니다. 공식 문서 기준 대표 봇들입니다.

운영사주 용도robots.txt 준수
OpenAIGPTBot모델 학습용 수집준수
OpenAIOAI-SearchBotChatGPT 검색의 노출용 수집준수
OpenAIOAI-AdsBot광고 랜딩페이지 안전성 확인공식 opt-out 지침 없음
OpenAIChatGPT-User사용자 요청 시 실시간 페이지 방문적용 안 될 수 있음
AnthropicClaudeBot모델 학습용 수집준수
AnthropicClaude-SearchBotClaude 검색 결과 품질 개선용 수집준수
AnthropicClaude-User사용자 질문에 답하기 위한 실시간 방문준수
PerplexityPerplexityBot검색 결과 노출용 수집준수
PerplexityPerplexity-User사용자 질문에 답하기 위한 실시간 방문무시함

같은 성격(사용자 요청 시 실시간 방문)의 봇이라도 회사마다 robots.txt 처리 방침이 다릅니다. Anthropic은 Claude-User도 robots.txt를 지킨다고 공식 문서에 명시하는 반면, Perplexity는 Perplexity-User를 "사용자가 요청한 가져오기라서 이 봇은 일반적으로 robots.txt 규칙을 무시한다"고 밝힙니다. 실시간 방문 봇이라고 다 같은 취급을 받는 게 아니라서, 차단 설정 전에 해당 운영사의 공식 문서로 확인해야 합니다.

구글은 구조가 다릅니다. 별도 AI 크롤러 대신 구글봇이 수집하고, Google-Extended라는 제어 토큰으로 Google 검색 밖 일부 AI 시스템의 학습과 그라운딩에 콘텐츠를 쓸지 정하게 합니다. AI Overviews와 AI Mode 노출을 제어하는 토큰은 아니며, 차단해도 Google 검색 색인에는 영향이 없습니다.

차단과 허용의 판단 기준

AI 크롤러는 robots.txt에서 User-Agent 단위로 제어합니다. 전부 막을지 열지보다, 목적별로 나눠 정하는 것이 실익에 맞습니다.

  • 학습용 봇 차단은 내 콘텐츠가 미래 모델의 학습 데이터로 쓰이는 것을 줄이려는 선택입니다
  • 검색용과 실시간 방문 봇 차단은 해당 서비스가 페이지를 가져올 기회를 줄일 수 있습니다. AI 검색 노출이 목표라면 봇별 역할과 공식 안내를 확인한 뒤 결정합니다

robots.txt는 규약을 지키는 봇에게만 유효합니다. Perplexity-User처럼 규약을 원래 지키지 않는 유형도 있고, 규약 자체를 무시하는 수집까지 막으려면 서버와 방화벽 수준의 차단이 필요합니다.

학습용 GPTBot은 막고 ChatGPT 검색용 OAI-SearchBot은 허용하려면 다음처럼 나눌 수 있습니다.

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

변경 뒤에는 robots.txt 검사와 서버 로그에서 두 User-Agent의 응답을 확인합니다. User-Agent 문자열은 사칭할 수 있으므로 공식 IP 목록도 함께 대조합니다.

봇 트래픽과 사칭 확인 방법

어떤 AI 봇이 얼마나 오는지는 서버 로그의 User-Agent에서 확인할 수 있습니다. 주요 운영사는 봇의 IP 대역을 json 파일로 공개합니다. OpenAI는 봇마다(gptbot.json, searchbot.json, chatgpt-user.json, adsbot.json), Perplexity는 perplexitybot.json과 perplexity-user.json으로 나눠 공개하고, Anthropic도 2026년 4월 갱신한 문서에서 통합 목록(bots.json)을 제공합니다. User-Agent 문자열만으로는 사칭을 가려낼 수 없으니, 의심되는 트래픽은 이 공식 IP 목록과 대조해야 합니다.

자주 묻는 질문

AI 크롤러를 차단하면 SEO에 불이익이 있나요?

Google-Extended 차단은 Google 검색 순위와 색인에 영향을 주지 않는다고 Google이 밝힙니다. 다른 AI 봇을 차단했을 때의 영향은 서비스와 봇 역할에 따라 다르며, 인용 감소 폭을 보장된 수치로 말할 수는 없습니다.

llms.txt를 만들면 AI 크롤러가 따르나요?

llms.txt는 접근 제어가 아니라 사이트 안내용 제안 표준이고, 주요 AI 봇이 공식 지원을 밝힌 상태도 아닙니다. 접근 제어는 robots.txt가 기준입니다.

뉴스나 이미지도 같은 방식으로 관리하나요?

원칙은 같지만 저작권 협의가 걸린 콘텐츠는 기술 설정 이전에 사업 결정의 영역입니다. 언론사들이 AI 기업과 콘텐츠 계약을 맺는 흐름처럼, 가치가 큰 콘텐츠일수록 차단이냐 계약이냐의 선택지가 됩니다.

Perplexity-User는 robots.txt로 못 막나요?

완전히는 못 막습니다. Perplexity 공식 문서는 이 봇이 사용자 요청을 받아 방문하기 때문에 robots.txt를 일반적으로 따르지 않는다고 밝혔습니다. 이 트래픽을 막으려면 서버나 방화벽 단에서 User-Agent나 공식 IP 목록 기준으로 별도 차단해야 합니다.

함께 알아두면 좋은 용어

  • 구글봇: 검색 색인용 크롤러
  • robots.txt: 봇별 접근을 제어하는 파일
  • llms.txt: LLM에게 사이트를 안내하는 제안 표준
  • AI 검색: 외부 정보를 찾아 생성형 답변을 만드는 서비스와 기능

참고 문서