Tenten AIGEO
블로그로 돌아가기
기술 AEO 구현도입·실행

5분 AI 크롤링 접근성 점검: robots.txt·렌더링·스키마 확인법

AI 검색에 노출되지 않는다면 콘텐츠보다 크롤러가 페이지를 읽지 못하는 것이 원인일 수 있습니다. 5분 만에 robots.txt의 GPTBot 차단 여부, JavaScript 의존 렌더링 여부, 스키마 구조화 데이터의 정확성을 확인하고 AI 크롤링 접근성의 문제와 수정 우선순위를 파악해 보세요.

Tenten GEO 팀게시일 2024-11-294 분 소요
반쯤 열린 게이트를 통과하는 스캔 빔으로 AI 크롤러가 웹페이지를 읽을 수 있는지를 표현한 이미지

AI 검색에서 자사 콘텐츠를 찾을 수 없다면 품질보다 크롤러가 페이지를 읽지 못하는 것이 원인일 수 있습니다. robots.txt가 GPTBot을 차단하거나, 텍스트가 JavaScript 실행 후에만 나타나거나, 페이지 전체에 구조화 데이터가 없을 수 있습니다. 이 셋 중 하나만 해당해도 공들여 작성한 콘텐츠가 AI 엔진에는 존재하지 않는 것이나 다름없습니다. 이런 문제는 30일간의 정밀 감사가 끝날 때까지 기다릴 필요가 없습니다. 5분 동안 세 단계만 확인하면 직접 진단할 수 있습니다.

먼저 알아둘 점: AI 크롤러는 Googlebot과 다릅니다

AI 엔진마다 데이터를 수집하는 자체 크롤러와 고유한 user-agent가 있으며, 작동 방식도 Googlebot과 다릅니다. 가장 큰 차이는 JavaScript 처리입니다. Googlebot은 검색 순위를 위해 페이지의 JavaScript를 실행하지만, 대부분의 AI 크롤러는 속도와 비용 때문에 원본 HTML 위주로 수집하고 JavaScript는 제한적으로 실행하거나 아예 실행하지 않습니다. 따라서 ‘Google 색인이 정상이다’라는 사실만으로 ChatGPT, Perplexity, Claude가 페이지를 읽을 수 있다고 판단해서는 안 됩니다. 기존 SEO 체크리스트를 그대로 적용하지 말고 AI 크롤러의 관점에서 별도로 점검해야 합니다.

1분 차: robots.txt에서 AI 크롤러 차단 여부 확인하기

도메인 뒤에 /robots.txt를 붙여 직접 엽니다. Ctrl+F로 아래 이름을 검색해 Disallow로 차단되어 있는지, 아니면 별도 언급이 없는지 확인합니다. 일반적으로 언급이 없으면 접근을 허용한 것입니다. 의도하지 않게 AI 크롤러를 막은 사이트도 많습니다. 보안 외주 업체, CDN 또는 플러그인의 기본 규칙이 Googlebot 이외의 모든 크롤러를 차단하면서 AI 엔진까지 함께 막는 경우입니다.

  • GPTBot: OpenAI가 학습 및 검색용 데이터를 수집하는 데 사용하는 크롤러입니다. 이를 차단하면 ChatGPT가 해당 콘텐츠를 가져올 수 없습니다.
  • OAI-SearchBot 및 ChatGPT-User: 각각 ChatGPT 검색과 사용자가 질문할 때 이루어지는 실시간 페이지 접근에 해당합니다.
  • ClaudeBot: Anthropic의 Claude가 웹페이지를 수집하고 검색하는 데 사용하는 크롤러입니다.
  • PerplexityBot 및 Perplexity-User: Perplexity가 검색 색인을 구축하고 요청 시 페이지를 즉시 읽는 데 사용합니다.
  • Google-Extended: 콘텐츠의 Gemini 사용 허용 여부를 제어합니다. 차단해도 일반 Google 검색 순위에는 영향을 주지 않지만 Gemini 답변에는 노출되지 않습니다.

2~3분 차: JavaScript를 꺼도 콘텐츠가 남아 있는지 확인하기

이 단계에서는 텍스트가 실제 HTML에 포함되어 있는지, 브라우저의 JavaScript 실행에 의존하는지 확인합니다. 가장 빠른 방법은 Chrome DevTools에서 JavaScript를 비활성화한 뒤 페이지를 새로고침하는 것입니다. 더 직접적으로 확인하려면 URL 앞에 view-source:를 붙여 소스 코드를 열고, Ctrl+F로 본문의 문장 하나를 통째로 검색합니다. 제목, 본문 또는 가격 정보가 검색되지 않는다면 해당 콘텐츠는 프런트엔드에서 렌더링되고 있다는 뜻입니다. 원본 HTML만 읽는 AI 크롤러에는 빈 껍데기만 전달됩니다. 텍스트 전용 브라우저라고 생각하면 이해하기 쉽습니다. 크롤러가 볼 수 있는 내용만 AI도 인용할 수 있습니다.

robots.txt, 페이지 렌더링, 스키마로 구성된 5분 AI 크롤링 접근성 점검의 세 단계
점검 항목은 세 가지입니다. 크롤러가 들어올 수 있는지, 콘텐츠를 수집할 수 있는지, 구조화 데이터가 정확한지 확인합니다.

4~5분 차: 스키마의 존재 여부와 정확성 확인하기

이번에도 view-source를 사용합니다. application/ld+json을 검색해 페이지에 구조화 데이터가 포함되어 있는지, 지정된 유형이 올바른지 확인합니다. 아티클 페이지에는 Article, 회사 페이지에는 Organization, 질의응답 페이지에는 FAQPage, 제품 페이지에는 Product가 있어야 합니다. 스키마가 검색 순위를 직접 높여 주는 것은 아닙니다. 대신 AI가 최소한의 비용으로 페이지의 주제, 작성자, 신뢰성을 파악하도록 돕습니다. 주의할 점은 잘못된 스키마가 스키마가 없는 것보다 더 해로울 수 있다는 사실입니다. FAQPage로 표시했지만 실제 질문과 답변이 없거나, 작성자·날짜·페이지 내용과 마크업 정보가 일치하지 않으면 AI는 해당 페이지를 신뢰하기 어렵다고 판단해 인용 가능성을 낮출 수 있습니다.

한눈에 보는 점검표: 5분 안에 확인해야 할 결과

  1. robots.txt: 위에 나열한 AI 크롤러가 Disallow로 차단되어 있지 않으며, User-agent: *와 Disallow: /를 조합한 사이트 전체 차단 설정도 없습니다.
  2. 렌더링: JavaScript를 꺼도 제목, 본문, 가격이나 사양 같은 핵심 수치를 원본 HTML에서 읽을 수 있습니다.
  3. 스키마: 페이지에 적합한 유형의 JSON-LD가 있으며, 마크업된 정보가 화면의 콘텐츠와 일치하고 허위이거나 만료된 정보가 아닙니다.
  4. 세 항목 모두 통과: AI 크롤링 접근성의 기본 요건을 갖췄습니다. 다음 단계는 콘텐츠와 인용에 적합한 구조를 최적화하는 것입니다.
  5. 한 항목이라도 통과하지 못함: 콘텐츠를 더 만들기 전에 멈추고, 발견된 문제부터 해결해야 합니다.
AI 크롤링 접근성은 인용 가능성을 높이는 가산점이 아니라, 인용 대상이 되기 위한 기본 조건입니다. 이 조건을 충족하지 못하면 콘텐츠가 아무리 좋아도 AI가 읽거나 인용할 수 없습니다.Tenten GEO Consulting Team

문제를 발견했다면 무엇부터 수정해야 할까요?

수정 우선순위는 명확합니다. 먼저 robots.txt 차단을 해제해야 합니다. 규칙 한 줄만 바꿔도 접근을 허용할 수 있어 영향이 가장 크고, 일반적으로 당일 적용됩니다. 그다음은 렌더링 문제입니다. 핵심 콘텐츠를 서버 사이드 렌더링으로 전환하거나 최소한 원본 HTML에 텍스트가 포함되도록 해야 하므로 대부분 개발 작업이 필요합니다. 비용은 더 들지만 AI가 콘텐츠를 읽을 수 있는지를 직접 결정합니다. 스키마는 마지막에 보완합니다. 스키마는 접근성을 0에서 1로 만드는 요소가 아니라 이미 갖춘 기반의 완성도를 높이는 요소입니다. 이 순서대로 진행하면 최소한의 작업으로 가장 치명적인 문제부터 해결할 수 있습니다.

이 5분 점검으로 눈에 띄는 문제 대부분을 찾을 수 있지만, 더 깊은 문제까지 확인할 수는 없습니다. 예를 들어 서버가 AI 크롤러와 일반 사용자에게 서로 다른 콘텐츠를 반환하거나, 인용될 문단의 구조가 지나치게 느슨하거나, 페이지 간 엔터티와 신뢰 신호가 일관되지 않을 수 있습니다. 이런 영역의 문제까지 파악하려면 30분 GEO 진단을 예약해 보세요. Tenten의 GEO 감사 관점에서 크롤링 접근성의 문제를 진단하고 바로 실행할 수 있는 개선 목록으로 정리해 드립니다.

자주 묻는 질문

AI 크롤러와 Googlebot은 같은가요? 둘 중 하나를 차단하면 어떻게 되나요?
같지 않습니다. GPTBot, ClaudeBot, PerplexityBot, Google-Extended는 각각 독립적으로 작동하므로 robots.txt에서 별도로 접근을 허용해야 합니다. Google에 정상적으로 색인되었다고 해서 ChatGPT나 Perplexity가 페이지를 읽을 수 있는 것은 아닙니다. 두 항목을 따로 점검해야 합니다.
JavaScript로 표시되는 콘텐츠가 AI 크롤링에 영향을 주는 이유는 무엇인가요?
대부분의 AI 크롤러는 JavaScript를 실행하지 않거나 완전하게 실행하지 않고 원본 HTML만 읽습니다. 텍스트, 제목, 가격이 프런트엔드 렌더링에 의존하면 크롤러에는 빈 껍데기만 전달되므로 AI가 인용할 콘텐츠도 사라집니다.
스키마가 없으면 AI가 페이지를 전혀 수집하지 못하나요?
전혀 수집하지 못하는 것은 아닙니다. 다만 스키마는 AI가 페이지의 주제, 작성자, 신뢰성을 빠르게 파악하도록 도와 인용 가능성을 높입니다. 잘못되거나 허위로 작성된 스키마는 스키마가 없는 것보다 더 해로울 수 있습니다. FAQ라고 표시했지만 실제 질문과 답변이 없다면 신뢰하기 어려운 페이지로 판단될 수 있습니다.

다음 단계

AI 답변에서 우리 브랜드는 얼마나 보일까요?

30분 GEO 진단을 통해 주요 AI 엔진에서의 가시성 격차와 우선 개선 과제를 확인해 보세요.

30분 진단 예약