커뮤니티 입장하기

AI 크롤러 허용과 차단 기준 정하기

AI 크롤러 접근 제어는 robots.txt와 서버 설정으로 AI 회사의 봇이 사이트를 가져갈 수 있는 범위를 정하는 일입니다. 같은 회사의 봇도 학습용, 검색 색인용, 사용자 요청용으로 나뉘어 있어서 무엇을 막느냐에 따라 AI 검색 인용이 달라집니다.

같은 말:GPTBot 차단AI 크롤러 robots.txtClaudeBotOAI-SearchBotGoogle-Extended

새로 올라온 개념이에요. 먼저 읽어 보고 퀴즈도 풀어 보세요
Share
목차
  1. 🤔 AI 크롤러를 막아야 할지 망설여질 때
  2. 🔑 AI 크롤러 접근 제어의 정의
  3. 🤖 주요 AI 크롤러의 이름과 용도
  4. 📝 학습은 막고 검색은 여는 robots.txt 예시
  5. ⚖️ 막을지 열지 정하는 세 가지 기준
  6. 🛡️ robots.txt만으로 막히지 않는 이유
  7. ✅ 설정한 뒤 확인하는 순서
  8. ⚠️ 자주 하는 실수
  9. ❓ 자주 묻는 질문
  10. 📋 3줄 요약
  11. 📚 참고 자료

🤔 AI 크롤러를 막아야 할지 망설여질 때

AI 회사가 내 글을 학습에 가져간다는 소식을 들으면 robots.txt에서 AI 봇을 전부 막고 싶어집니다. 쿠팡과 네이버 쇼핑도 2026년 9월 2일 기준 AI 크롤러를 학습용과 검색용을 가리지 않고 막습니다. 그런데 무작정 따라 막으면 챗GPT 검색이나 퍼플렉시티 답변에서 우리 사이트가 함께 사라질 수 있습니다.

AI 봇은 하나가 아닙니다. 같은 회사의 봇도 학습용과 검색 색인용, 사용자가 요청할 때 페이지를 여는 용도로 나뉘어 있습니다. 지금부터 주요 AI 크롤러의 이름과 용도, 학습은 막고 검색은 여는 설정, 우리 사이트에 맞는 판단 기준을 2026년 9월 28일 공식 문서 기준으로 정리합니다.

🔑 AI 크롤러 접근 제어의 정의

AI 크롤러 접근 제어는 robots.txt와 서버 설정으로 AI 회사의 봇이 사이트를 가져갈 수 있는 범위를 정하는 일입니다.

크롤러는 웹 페이지를 자동으로 방문해 내용을 가져가는 프로그램이고, 검색엔진 크롤러의 기본 동작은 검색엔진 크롤러 이해하기에 있습니다. robots.txt는 사이트 최상위 경로에 두는 텍스트 파일로, 어떤 봇이 어느 경로에 들어와도 되는지 적어 둡니다. 파일 문법은 robots.txt 알아보기에서 다뤘습니다.

🤖 주요 AI 크롤러의 이름과 용도

봇마다 하는 일이 다르므로 이름보다 용도를 먼저 봅니다. 사용자 에이전트(user agent)는 봇이 방문할 때 자기를 밝히는 이름표입니다.

회사학습용검색 색인용사용자 요청용
OpenAIGPTBotOAI-SearchBotChatGPT-User
앤트로픽ClaudeBotClaude-SearchBotClaude-User
퍼플렉시티없음(PerplexityBot은 모델 학습에 쓰지 않는다고 밝힘)PerplexityBotPerplexity-User
구글Google-Extended(토큰)Googlebot해당 없음
애플Applebot-Extended(토큰)Applebot해당 없음

표에 적힌 봇의 성격을 공식 문서 기준으로 풀면 이렇습니다.

  • OAI-SearchBot: 이 봇을 막은 사이트는 챗GPT 검색 답변에 나오지 않는다고 OpenAI가 밝힙니다. 이름만 적힌 탐색용 링크로는 나타나기도 합니다. robots.txt를 바꾸면 검색에 반영되기까지 24시간쯤 걸립니다
  • ChatGPT-User와 Perplexity-User: 사용자가 요청할 때만 페이지를 여는 봇이라 robots.txt 규칙이 적용되지 않을 수 있다고 각 회사가 설명합니다
  • Claude-SearchBot과 Claude-User: 앤트로픽은 이 둘을 막으면 검색에서 사이트가 덜 보일 수 있다고 안내하고, 세 봇 모두 robots.txt를 따른다고 밝힙니다
  • Google-Extended: 별도 크롤러가 아니라 제미나이 학습과 그라운딩(답변 근거 찾기)을 정하는 토큰이고, 구글 검색 노출이나 순위에는 영향을 주지 않습니다
  • Applebot-Extended: 페이지를 수집하지 않는 학습 거부용 토큰이고, 막아도 애플 검색 결과에는 나옵니다

구글 AI 개요와 AI 모드는 Google-Extended가 아니라 Googlebot 규칙을 따릅니다. 내용 노출을 줄이고 싶다면 nosnippet, data-nosnippet, max-snippet 같은 스니펫 설정이나 noindex를 씁니다. 마이크로소프트 빙은 공식 문서에 별도 AI 크롤러 이름이 없고, 대신 NOARCHIVE 메타 태그를 넣으면 코파일럿 답변과 학습에서 빠지고 일반 검색 결과에는 남는다고 안내합니다. 공개 웹을 대량으로 모아 여러 회사의 학습 자료로 쓰이는 커먼 크롤(Common Crawl)의 봇 이름은 CCBot입니다.

📝 학습은 막고 검색은 여는 robots.txt 예시

OpenAI는 GPTBot과 OAI-SearchBot 설정이 서로 독립적이라, OAI-SearchBot은 허용하고 GPTBot은 막을 수 있다고 안내합니다. 이 원리로 학습용 봇만 막고 검색 색인용 봇은 여는 파일을 만듭니다. 쿠팡과 네이버의 robots.txt 분석에 적은 절충안을 옮기면 다음과 같습니다.

# 학습용 봇은 막는다 User-agent: GPTBot User-agent: ClaudeBot User-agent: CCBot User-agent: Google-Extended User-agent: Applebot-Extended Disallow: / # 검색과 답변 인용에 쓰이는 봇은 연다 User-agent: OAI-SearchBot User-agent: Claude-SearchBot User-agent: PerplexityBot Allow: / # 나머지는 기본 규칙 User-agent: * Disallow: /cart/ Disallow: /order/

Googlebot과 Bingbot은 마지막 기본 규칙을 따르므로 장바구니와 주문 경로만 막히고 나머지는 열립니다. 앤트로픽은 하위 도메인마다 robots.txt를 따로 두라고 안내하므로, blog.example.com처럼 하위 도메인을 쓴다면 거기에도 같은 파일을 둡니다.

⚖️ 막을지 열지 정하는 세 가지 기준

쿠팡이 AI 봇을 전부 막을 수 있는 것은 자체 앱과 직접 방문이 유입의 대부분이고, 쿠팡 파트너스라는 제휴망이 외부 유입을 대신 만들어 주기 때문입니다. 같은 선택이 모든 사이트에 맞지는 않습니다.

기준닫는 쪽이 맞는 경우여는 쪽이 맞는 경우
자체 채널 비중앱과 직접 방문이 유입의 대부분검색과 추천이 신규 고객의 주된 경로
데이터 민감도가격과 재고, 후기가 경쟁사에 바로 쓰이는 자산콘텐츠가 널리 인용될수록 이득
대체 유입 경로제휴망이나 자체 AI로 유입을 만들 수 있음무료 노출 말고 다른 유입 경로가 약함

세 기준 가운데 둘 이상이 여는 쪽이라면 학습용 봇만 막고 검색 색인용 봇은 여는 절충에서 시작하는 편이 안전합니다. 블로그나 서비스 소개 사이트처럼 인용될수록 이름이 알려지는 곳이라면 학습용 봇까지 여는 선택도 있습니다.

🛡️ robots.txt만으로 막히지 않는 이유

robots.txt 표준 문서인 RFC 9309는 이 규약이 콘텐츠 보안 수단을 대신하지 않는다고 명시합니다. 가게 문 앞에 붙인 안내문처럼 들어오는 쪽이 지켜 줄 때만 효력이 있고, 사용자 요청용 봇처럼 규칙을 적용하지 않는 봇도 있습니다.

그래서 실제 차단은 CDN과 서버가 맡습니다. CDN은 사이트 앞단에서 접속을 받아 전달하는 서비스입니다. 클라우드플레어는 2025년 7월 1일부터 새로 등록하는 도메인에 AI 크롤러를 허용할지 묻기 시작했고, 관리형 robots.txt에 검색은 허용하고 AI 학습은 거부하는 콘텐츠 신호를 기본으로 넣어 줍니다. 클라우드플레어 봇 차단 정리에서는 AI 봇을 검색, 학습, 에이전트 세 분류로 나눠 막는 설정을 다뤘습니다.

반대 방향의 사고도 조심합니다. 서버 쪽 봇 차단을 강하게 켜 두면 robots.txt에서 허용한 OAI-SearchBot까지 방화벽이 먼저 막아 버리기도 합니다. OpenAI도 호스팅 업체나 CDN이 자사가 공개한 IP 범위를 허용하는지 확인하라고 안내합니다.

✅ 설정한 뒤 확인하는 순서

  1. 파일 열어 보기: 브라우저에서 도메인/robots.txt를 열어 의도한 규칙이 올라가 있는지 봅니다
  2. CDN 설정 보기: 봇 차단 기능이 검색 색인용 봇까지 막고 있지 않은지 봅니다
  3. 서버 로그 보기: 허용한 봇의 사용자 에이전트가 실제로 들어와 200 응답을 받는지 봅니다
  4. 가짜 봇 걸러 내기: 사용자 에이전트는 누구나 흉내 낼 수 있어서, OpenAI와 커먼 크롤처럼 IP 범위를 공개한 회사의 봇은 IP까지 맞춰 봅니다

⚠️ 자주 하는 실수

  • AI 봇을 한꺼번에 막습니다: 검색 색인용 봇까지 막혀 챗GPT 검색과 퍼플렉시티 답변에서 빠집니다
  • Google-Extended를 막아 AI 개요를 피하려 합니다: AI 개요는 Googlebot 규칙을 따르므로 효과가 없습니다
  • robots.txt를 보안 설정으로 봅니다: 표준 문서가 보안 수단이 아니라고 밝힌 안내문입니다
  • 하위 도메인을 빠뜨립니다: 하위 도메인마다 파일이 따로 필요합니다

❓ 자주 묻는 질문

GPTBot을 막으면 챗GPT 검색에서도 빠지나요?

빠지지 않습니다. OpenAI는 학습용 GPTBot과 검색용 OAI-SearchBot 설정이 서로 독립적이라고 안내합니다. 챗GPT 검색 답변에서 빠지는 것은 OAI-SearchBot을 막았을 때입니다.

Google-Extended를 막으면 구글 검색에 불리한가요?

불리하지 않습니다. 구글은 Google-Extended가 구글 검색 노출에 영향을 주지 않고 순위 신호로도 쓰이지 않는다고 밝힙니다. 제미나이 학습과 그라운딩에 쓰이는 범위만 정하는 토큰입니다.

robots.txt를 고치면 바로 반영되나요?

회사마다 다릅니다. OpenAI는 OAI-SearchBot 설정 변경이 검색에 반영되기까지 24시간쯤 걸린다고 안내하고, 표준 문서는 크롤러가 받아 둔 파일을 24시간 넘게 쓰지 않도록 권합니다.

사용자가 챗GPT에 붙여 넣은 링크도 막을 수 있나요?

robots.txt로는 어렵습니다. ChatGPT-User는 사용자가 요청할 때 페이지를 여는 봇이라 규칙이 적용되지 않을 수 있다고 OpenAI가 밝힙니다. 꼭 막아야 한다면 서버나 CDN에서 접속을 끊는 방법을 써야 하고, 그만큼 사용자가 공유한 링크도 열리지 않습니다.

📋 3줄 요약

  1. OpenAI와 앤트로픽은 학습용과 검색 색인용, 사용자 요청용 봇을 따로 운영하므로 GPTBot과 ClaudeBot만 막고 OAI-SearchBot과 Claude-SearchBot을 열면 학습은 거부하면서 AI 검색 인용은 남길 수 있습니다.

  2. 구글 AI 개요와 AI 모드는 Googlebot 규칙을 따르고 Google-Extended는 제미나이 학습과 그라운딩만 정하는 토큰이라 이 토큰을 막아도 구글 검색 노출은 달라지지 않습니다.

  3. robots.txt는 표준 문서 RFC 9309가 보안 장치가 아니라고 밝힌 안내문이고 사용자 요청용 봇에는 적용되지 않을 수 있어서 실제 차단은 CDN과 서버 설정이 맡습니다.

📚 참고 자료

Share

제대로 이해했는지 한 문제로 확인해 볼까요?

답을 고르면 바로 풀이가 나와요.

robots.txt에서 GPTBot만 막고 OAI-SearchBot은 허용했을 때 맞는 설명은 무엇일까요?

3개념 / 클래스AI 검색에 인용되는 페이지 구조 만들기