robots.txt에 Disallow 한 줄을 추가해 GPTBot을 차단하면 ChatGPT가 자사 콘텐츠를 인용하지 않을 것이라고 생각하는 경우가 많습니다. 하지만 실제로는 어느 쪽도 맞지 않습니다. GPTBot은 모델 학습용 데이터를 수집하는 크롤러일 뿐입니다. ChatGPT 답변에 콘텐츠가 노출되는지를 좌우하는 것은 OAI-SearchBot이라는 별도의 크롤러입니다. 같은 회사가 운영하더라도 역할이 다르면 서로 다른 User-Agent를 사용합니다. 따라서 robots.txt의 허용·차단 정책을 정하기 전에 목록에 있는 각 크롤러가 무슨 일을 하는지부터 구분해야 합니다.
먼저 구분해야 할 세 가지 AI 크롤러 유형
- 학습형 크롤러: 콘텐츠를 수집해 모델의 학습 말뭉치에 포함합니다. 일반적으로 오프라인에서 처리되며, 사용자가 현재 보고 있는 답변과 직접 연결되지는 않습니다. GPTBot(OpenAI), ClaudeBot(Anthropic), CCBot(Common Crawl), Meta-ExternalAgent, Bytespider(ByteDance)가 대표적입니다.
- 검색·색인형 크롤러: AI 답변 엔진이 즉시 검색할 수 있는 색인을 구축합니다. 페이지가 참고 출처로 활용될지를 직접 좌우합니다. OAI-SearchBot(ChatGPT 검색), PerplexityBot, Googlebot(AI Overviews는 기존 색인을 활용), Applebot(Siri 및 Apple Intelligence)이 대표적입니다.
- 사용자 요청형 크롤러: 사용자가 대화창에 URL을 붙여 넣거나 즉시 확인을 요청할 때 작동합니다. 대체로 한 번에 한 페이지만 읽으며 학습 데이터에는 포함하지 않습니다. ChatGPT-User, Perplexity-User, Claude-User가 대표적입니다.
AI 답변에 인용되기를 원한다면 검색·색인형과 사용자 요청형은 차단하지 않는 편이 좋습니다. 검색형 크롤러가 접근하지 못하면 후보 출처 목록에 들어갈 수 없습니다. 사용자 요청형을 막으면 누군가 직접 링크를 제공해도 AI가 내용을 읽지 못합니다. 반면 학습형은 브랜드 전략에 따라 선택할 수 있습니다. 콘텐츠가 무상으로 학습에 쓰이는 것이 우려된다면 차단하고, 모델의 기반 말뭉치에 포함될 가능성을 높이고 싶다면 허용하면 됩니다. 이 세 계층을 혼동하는 것이 robots.txt 정책을 거꾸로 설정하는 가장 흔한 원인입니다.
OpenAI: GPTBot, OAI-SearchBot, ChatGPT-User
- GPTBot: 학습용 크롤러입니다. User-Agent에는 "GPTBot/1.2"가 포함되며 robots.txt 토큰은 "GPTBot"입니다. OpenAI는 크롤러의 IP 대역도 JSON 파일로 공개하므로 실제 OpenAI 크롤러인지 확인할 수 있습니다.
- OAI-SearchBot: 페이지를 ChatGPT의 검색·인용 출처에 포함하는 역할을 하며 토큰은 "OAI-SearchBot"입니다. 이를 차단하면 ChatGPT에서의 브랜드 노출을 스스로 포기하는 셈이지만, 많은 운영자가 가장 자주 잘못 차단하는 크롤러이기도 합니다.
- ChatGPT-User: 사용자가 대화 중 특정 URL을 열거나 확인해 달라고 요청할 때 작동합니다. 토큰은 "ChatGPT-User"입니다. 실시간으로 한 페이지만 크롤링하며 학습에는 사용되지 않습니다.
Google-Extended는 크롤러가 아니라 제어 스위치입니다
Google-Extended는 흔히 ‘AI 크롤러 목록’에 포함되지만, 서버 로그에 나타나는 크롤러가 아닙니다. robots.txt에서 사용하는 제품 토큰입니다. 이를 허용하거나 차단하면 Google이 콘텐츠를 Gemini 학습과 일부 생성 기능에 사용할 수 있는지만 달라지며, Googlebot의 일반 색인 생성에는 영향을 주지 않습니다. 따라서 Google-Extended를 차단해도 Google 검색에서 제외되지 않으며, 일반적으로 AI Overviews에서도 사라지지 않습니다. AI Overviews는 주로 Googlebot이 구축한 기존 색인을 활용하기 때문입니다. Apple의 Applebot-Extended도 같은 방식입니다. Apple Intelligence 학습을 제어하는 스위치이며, 일반 색인을 담당하는 Applebot과는 다릅니다.
PerplexityBot과 규칙을 따르지 않는 크롤러들
Perplexity에서 참고 출처로 노출되려면 PerplexityBot(색인)과 Perplexity-User(사용자 실시간 요청)를 모두 허용해야 합니다. 다만 현실적인 한계도 있습니다. robots.txt는 강제력이 없는 신사협정에 가깝습니다. 2025년 Cloudflare는 Perplexity가 robots.txt로 차단된 뒤 일반 브라우저로 위장한 미공개 User-Agent를 사용해 크롤링을 계속했다고 공개적으로 지적했습니다. Bytespider 역시 과거 속도 제한을 거의 고려하지 않는 고빈도 크롤링으로 알려졌습니다. 결국 두 가지 문제가 동시에 존재합니다. 차단하려는 크롤러가 실제로는 막히지 않을 수 있고, 허용하려는 크롤러도 공식 운영 주체가 보낸 것이 맞는지 검증해야 합니다.
로그에서 마주치게 될 Amazonbot, ClaudeBot과 기타 크롤러
- ClaudeBot: Anthropic의 학습형 크롤러입니다. 사용자 요청형인 Claude-User와 이전 토큰인 anthropotic-ai, Claude-Web도 있어 로그에 함께 나타날 수 있습니다.
- Amazonbot: Alexa와 Amazon의 AI 서비스에서 사용합니다. User-Agent에는 "Amazonbot/0.1"이 포함됩니다.
- CCBot: Common Crawl의 크롤러입니다. Common Crawl 자체는 AI 기업이 아니지만, 수집한 공개 말뭉치를 다수의 모델이 활용합니다. 간접적인 학습 파이프라인이어서 학습형 크롤러를 관리할 때 특히 놓치기 쉽습니다.
- 그 밖의 주요 이름: Meta-ExternalAgent(Meta 학습형), Meta-ExternalFetcher(사용자 요청형), YouBot(You.com), DuckAssistBot(DuckDuckGo), cohere-ai(Cohere), MistralAI-User, Diffbot, Timpibot이 있습니다.

2026년 robots.txt 작성 방법
모든 사이트에 통하는 정답은 없습니다. 다만 GEO를 추진하는 대부분의 B2B 웹사이트라면 다음을 기본 정책으로 삼을 수 있습니다. AI 엔진이 콘텐츠를 읽고 인용할 수 있도록 검색형과 사용자 요청형은 허용하고, 학습형은 콘텐츠 가치와 브랜드 전략에 따라 개별적으로 결정합니다. 아래는 브랜드 노출을 우선한 설정 예시입니다.
- User-agent: OAI-SearchBot → Allow: / (ChatGPT 브랜드 노출 유지)
- User-agent: PerplexityBot → Allow: / (Perplexity 참고 출처 풀에 포함)
- User-agent: ChatGPT-User 및 Perplexity-User → Allow: / (사용자의 직접 확인 요청을 차단하지 않음)
- User-agent: Googlebot → Allow: / (AI Overviews와 일반 검색이 같은 색인을 사용하므로 반드시 허용)
- User-agent: GPTBot, CCBot, Google-Extended → 정책에 따라 결정 (학습에 사용되는 것을 원하지 않으면 Disallow: /로 설정해도 위 검색 노출에는 영향을 주지 않음)
robots.txt에 모든 것을 맡기지 마세요
robots.txt는 규칙을 준수하는 크롤러는 막을 수 있지만, 의도적으로 우회하는 크롤러까지 차단하지는 못합니다. 통제를 강화하려면 한 단계 더 나아가야 합니다. 역방향 DNS 조회 후 정방향 조회로 재확인하고, 각 기업이 공식 발표한 IP 대역과 대조해 크롤러의 진위를 검증해야 합니다. 위장이나 고빈도 크롤링에는 robots.txt에 한 줄을 더 추가하는 대신 WAF, Cloudflare의 AI 크롤러 관리 기능 또는 속도 제한을 적용하는 편이 효과적입니다. 모니터링도 중요합니다. 서버 액세스 로그를 정기적으로 확인해 어떤 AI 크롤러가 실제로 방문했으며 빈도는 어느 정도인지 파악해야 합니다. 이는 GEO 노출을 판단할 수 있는 가장 정확한 1차 신호로, 어떤 예측보다 신뢰할 만합니다.
AI 크롤러 목록은 분기마다 달라집니다. 새로운 이름이 등장하고 토큰도 바뀝니다. 개별 이름을 모두 외우기보다 학습형·검색형·사용자 요청형이라는 분류 원칙을 기억하는 편이 유용합니다. 유형마다 전략적 영향이 다르기 때문입니다. 현재 어떤 AI 엔진이 자사 사이트를 크롤링하고 있는지, 인용돼야 할 페이지 가운데 누락된 것은 무엇인지 확실하지 않다면 Tenten의 GEO 감사를 통해 크롤러 접근 기록과 인용 현황을 한눈에 확인할 수 있습니다. 먼저 격차를 진단하려면 30분 GEO 진단을 예약하세요(/contact).



