Tenten AIGEO
블로그로 돌아가기
기술 AEO 구현검토

LLM 크롤링을 위한 웹사이트 아키텍처 설계: 토픽 클러스터와 내부 링크 완전 전략

LLM은 사이트 전체를 크롤링한 뒤 순위를 매기지 않습니다. 질문과 가장 관련성이 높은 문단을 즉시 가져와 답변을 구성합니다. 이 글에서는 토픽 클러스터와 내부 링크를 활용해 웹사이트 구조를 재편하고, 각 페이지가 AI 엔진에 명확히 추출되면서 신뢰할 수 있는 출처로 평가받게 하는 방법을 설명합니다. 90일 안에 실행할 수 있는 단계별 계획도 함께 제시합니다.

Tenten GEO 팀게시일 2025-11-214 분 소요
중앙 허브를 둘러싼 여러 클러스터가 빛나는 노드와 연결선으로 이어져 LLM 검색에 맞춰 설계된 웹사이트 아키텍처를 표현한 이미지

LLM은 Google처럼 사이트 전체를 먼저 크롤링한 뒤 순위를 정하지 않습니다. 사용자가 질문하면 관련성이 가장 높다고 판단한 몇 개의 콘텐츠 조각을 즉시 가져와 답변을 구성하고 출처 링크를 붙입니다. 따라서 웹사이트 아키텍처의 목표도 달라져야 합니다. 홈페이지를 검색 결과 최상단에 올리는 데 그치지 않고, 모든 문단이 독립적으로 선택되고 이해되며 신뢰할 수 있는 출처로 표시될 수 있어야 합니다. 대부분의 B2B SaaS 웹사이트는 10년 전 키워드 순위 경쟁에 맞춰 설계되어 있어 이 새로운 기준에서는 큰 손해를 볼 수 있습니다.

LLM이 웹사이트를 읽는 방식은 Google과 다릅니다

전통적인 크롤러는 페이지 전체를 색인하고 링크 가중치를 계산해 페이지 단위로 점수를 부여합니다. 생성형 엔진의 처리 방식은 다릅니다. 먼저 웹페이지를 세그먼트로 나누고(일반적으로 한 문단에서 여러 문단), 각 세그먼트의 벡터 인덱스를 만든 뒤 질문에 답할 때 가장 관련성 높은 세그먼트만 모델에 전달합니다. 인용 단위는 페이지가 아니라 문단입니다. 핵심 내용이 긴 서사 속에 흩어져 있어 독자가 직접 맥락을 조합해야 한다면, 엔진은 일부만 가져가거나 아예 건너뛸 가능성이 큽니다.

이 차이는 사이트 전체를 어떻게 구성해야 하는지 결정합니다. 엔진은 먼저 페이지를 발견하고, 해당 페이지가 어떤 주제에 속하는지 판단한 다음, 사이트가 그 주제를 충분히 깊이 다뤘는지 확인해야 관련 질문의 출처 후보로 포함합니다. 아키텍처의 역할은 다음 세 가지를 명확히 보여주는 것입니다. 이 페이지가 무엇을 다루는지, 사이트 내 어떤 페이지들과 같은 주제를 공유하는지, 그리고 해당 주제를 충분히 포괄했는지입니다.

토픽 클러스터: 특정 주제의 권위 있는 출처임을 엔진에 알리는 구조

현재 토픽 클러스터는 LLM 검색 로직에 가장 잘 맞는 아키텍처입니다. 핵심 주제를 정하고 전체 내용을 포괄하는 필러 페이지를 만든 뒤, 각각 하나의 하위 주제를 깊이 다루는 클러스터 페이지를 작성해 서로 연결합니다. 상호 연결된 페이지들이 일관된 용어를 사용하면서 내용을 보완하고 있으면, 엔진은 이를 고립된 개별 글이 아니라 해당 주제를 다루는 신뢰도 높은 출처로 판단하기 쉽습니다.

필러 페이지는 주제의 정의, 범위, 의사결정 구조를 설명하는 ‘폭’을 담당합니다. 독자와 엔진이 한 페이지에서 전체 맥락을 파악할 수 있어야 합니다. 클러스터 페이지는 ‘깊이’를 담당합니다. 각 페이지는 ‘내부 링크의 앵커 텍스트는 어떻게 작성해야 하는가’ 또는 ‘robots.txt에서 GPTBot을 허용해야 하는가’처럼 구체적인 문제만 해결합니다. 두 역할은 명확히 구분해야 합니다. 같은 하위 주제가 3~4개 페이지에 흩어져 서로의 초점을 흐리면 엔진은 어느 페이지를 인용해야 할지 판단하기 어렵습니다.

  • 필러 페이지: 핵심 주제 전체를 포괄하며, 대체로 분량이 길고 전체 클러스터로 진입하는 관문 역할을 합니다.
  • 6~12개의 연재형 클러스터 페이지: 각 글은 독립된 콘텐츠로 성립하는 하위 주제에 집중하며, 제목 자체가 실제 질문을 담아야 합니다.
  • 양방향 링크: 각 클러스터 페이지는 필러 페이지로 연결하고, 필러 페이지도 관련 문단에서 각 클러스터 페이지로 연결합니다.
  • 일관된 용어: 클러스터 전체에서 같은 용어 체계를 사용합니다. 어떤 페이지에서는 ‘생성형 엔진’, 다른 페이지에서는 ‘AI 검색’이라고 부르는 식의 혼용을 줄여 엔진의 이해 부담을 낮춰야 합니다.
  • 고립 페이지 방지: 모든 페이지는 클러스터 내 최소 2개 페이지와 연결되어야 합니다. 그렇지 않으면 크롤러가 해당 페이지에 도달하지 못할 수 있습니다.
토픽 클러스터 아키텍처 다이어그램: 중앙의 필러 페이지가 양방향 내부 링크로 여러 클러스터 페이지와 연결되어 엔진이 인식할 수 있는 주제 권위성을 형성합니다.
필러 페이지가 여러 하위 주제의 클러스터 페이지로 연결되고, 내부 링크를 통해 LLM이 클러스터 전체를 동일 주제에 관한 권위 있는 출처로 인식하게 합니다.

내부 링크: 가중치 전달 통로가 아닌 의미 지도

아직도 많은 사람이 내부 링크를 점수를 주고받는 통로, 즉 ‘가중치 전달’ 수단으로만 생각합니다. 그러나 LLM 검색에서 내부 링크는 의미 지도에 가깝습니다. 어떤 페이지들이 같은 주제를 다루는지, 서로 어떤 상하 관계에 있는지를 엔진에 알려주기 때문입니다. 특히 앵커 텍스트가 중요합니다. 링크에 사용된 짧은 문구는 ‘이 링크가 어떤 주제로 이어지는가’를 판단하는 가장 직접적인 단서가 됩니다. 따라서 대상 페이지의 주제를 설명하는 구체적인 표현을 사용하고, ‘여기를 클릭하세요’나 ‘자세히 알아보기’는 피해야 합니다. 링크의 위치도 영향을 줍니다. 본문 맥락에 자연스럽게 포함된 링크가 페이지 끝에 일렬로 배치된 관련 글 링크보다 가치가 높습니다.

모든 페이지를 명확하게 추출할 수 있도록 설계합니다

전체 구조가 올바르더라도 개별 페이지가 쉽게 추출되지 않으면 소용이 없습니다. 엔진은 그 자체로 의미가 완결된 문단을 선호합니다. 하나의 문단 안에서 주장과 이해에 필요한 맥락을 함께 설명해, 앞의 세 문단까지 거슬러 올라가지 않아도 뜻을 파악할 수 있어야 합니다. 결론을 문단 앞에 두고, 문단마다 한 가지 내용만 다루며, 내용을 설명하는 소제목으로 구간을 나누면 추출 성공률을 크게 높일 수 있습니다. 제목 계층도 실제 정보 구조와 일치해야 합니다. H2와 H3를 올바르게 중첩하고, 화면 배치를 위해 계층을 임의로 건너뛰지 마십시오. 여기에 정돈된 FAQ와 Article 구조화 데이터를 추가하면 엔진이 핵심 내용을 미리 파악할 수 있습니다. 각각은 사소해 보이지만 누적되면 인용 여부를 결정합니다. Tenten GEO의 GEO 감사는 사이트 전체의 클러스터 구조, 내부 링크, 접근성을 한 번에 점검해 끊어진 연결을 찾아냅니다.

크롤러가 들어오지 못하면 앞선 작업은 모두 무용지물입니다

아키텍처가 아무리 뛰어나도 AI 크롤러가 접근하지 못하면 모든 효과가 사라집니다. 가장 자주 간과되지만 치명적인 영역이므로 분기마다 점검할 가치가 있습니다.

  • robots.txt가 AI 크롤러를 실수로 차단하고 있지 않은가: GPTBot, ClaudeBot, PerplexityBot, Google-Extended를 의도적으로 허용했는지, 아니면 실수로 차단했는지 확인합니다.
  • 핵심 콘텐츠가 프런트엔드 JavaScript로 렌더링되는가: 많은 AI 크롤러는 JS를 실행하지 않아 빈 화면 구조만 보게 됩니다. 핵심 콘텐츠는 HTML 소스 코드에 포함되어야 합니다.
  • 사이트맵(sitemap.xml)이 완전하고 최신 상태인가: 크롤러가 신뢰할 수 있는 페이지 목록을 제공해야 합니다.
  • 중요 페이지의 로딩 속도와 서버 응답은 안정적인가: 시간 초과가 반복되거나 5xx 응답이 발생하면 크롤러가 방문 빈도를 낮추거나 크롤링을 중단할 수 있습니다.

90일 실행 계획은 어떻게 구성해야 할까요?

  1. 첫 번째 단계에서는 기존 콘텐츠를 점검하고 주제별로 분류합니다. 이미 클러스터가 형성된 주제와 개별 글만 흩어져 있는 주제를 구분합니다.
  2. 두 번째 단계에서는 각 핵심 주제의 전체 맥락을 설명하는 필러 페이지를 새로 만들거나 기존 페이지를 다시 작성합니다.
  3. 세 번째 단계에서는 클러스터 페이지 사이의 내부 링크를 보완하고 고립 페이지를 없애며 클러스터 전체의 용어를 통일합니다.
  4. 4단계에서는 접근성 문제를 해결합니다. robots.txt를 점검하고 핵심 콘텐츠가 HTML에 포함되어 있는지 확인한 뒤 사이트맵을 업데이트합니다.
  5. 다섯 번째 단계에서는 브랜드 노출 추적 도구로 각 엔진의 인용 현황을 모니터링하고, 데이터를 바탕으로 다음 작업에서 보완할 질문을 정합니다.

웹사이트 아키텍처는 GEO에서 가장 화려하지 않으면서 단기간에 구현하기도 가장 어려운 영역입니다. 제목 몇 개를 바꾸는 것처럼 효과가 즉시 나타나지는 않습니다. 그러나 클러스터와 링크의 뼈대를 제대로 세우면 새 콘텐츠를 만들 때마다 기존의 주제 권위가 강화되고, 각 콘텐츠가 따로 성과를 내야 하는 상황에서 벗어날 수 있습니다. 현재 아키텍처가 LLM 검색에서 어디를 놓치고 있는지 먼저 파악하고 싶다면 30분 GEO 진단을 예약해 보십시오. 클러스터의 단절 지점과 접근성 문제를 직접 짚어드립니다.

자주 묻는 질문

토픽 클러스터와 일반적인 블로그 카테고리는 무엇이 다른가요?
카테고리는 글에 라벨을 붙여 분류하고 보관하는 데 그칩니다. 토픽 클러스터는 필러 페이지와 여러 하위 주제의 클러스터 페이지를 양방향 내부 링크로 연결합니다. 이를 통해 AI 엔진은 사이트가 해당 주제를 충분히 포괄했고 인용할 가치가 있다고 판단할 수 있습니다.
LLM 검색에 유리한 내부 링크 앵커 텍스트는 어떻게 작성해야 하나요?
‘여기를 클릭하세요’나 ‘자세히 알아보기’ 대신 ‘생성형 엔진을 위한 내부 링크 원칙’처럼 대상 페이지의 주제를 설명하는 구체적인 표현을 앵커로 사용합니다. 이 짧은 문구가 링크의 도착 주제를 판단하는 가장 직접적인 단서가 됩니다.
robots.txt에서 AI 크롤러를 허용해야 하나요?
AI 엔진의 출처로 인용되기를 원한다면 GPTBot, ClaudeBot, PerplexityBot, Google-Extended 같은 크롤러를 허용해야 합니다. 먼저 의도적으로 차단했는지, 실수로 차단했는지 확인하십시오. 차단된 페이지는 검색하거나 인용할 수 없습니다.

다음 단계

AI 답변에서 우리 브랜드는 얼마나 보일까요?

30분 GEO 진단을 통해 주요 AI 엔진에서의 가시성 격차와 우선 개선 과제를 확인해 보세요.

30분 진단 예약