AI가 내 콘텐츠를 인용하지 않는 이유는 Google 검색 결과의 순위가 낮아서가 아닐 수 있습니다. 콘텐츠가 ‘벡터 공간’에서 독자의 실제 질문과 너무 멀리 떨어져 있기 때문일 가능성이 큽니다. 이 거리를 결정하는 것이 임베딩 벡터(Embeddings)입니다. 이 원리를 이해하면 공들여 쓴 페이지조차 AI가 완전히 외면하는 이유를 알 수 있습니다.
임베딩 벡터란 정확히 무엇일까요?
임베딩 벡터는 텍스트를 긴 숫자열로 변환하는 기술입니다. 이미지, 동영상, 코드도 같은 방식으로 변환할 수 있습니다. 숫자열은 보통 수백에서 수천 개의 차원으로 구성되며, 일종의 의미 좌표라고 보면 됩니다. 뜻이 비슷한 문장일수록 좌표가 가깝고, 관련이 없는 문장일수록 멀어집니다. ‘직원 이직률을 낮추는 방법’과 ‘인재를 유지하는 방법’은 겹치는 단어가 거의 없지만 같은 주제를 다루기 때문에 벡터 공간에서는 거의 맞닿아 있습니다.
이는 기존 키워드 대조와 전혀 다른 방식입니다. 키워드 대조는 본문에 ‘이직률’이라는 표현이 실제로 등장하는지 확인하지만, 임베딩 벡터는 문장이 의미상 무엇을 말하는지 파악합니다. 전자가 단어를 찾는다면 후자는 의미를 찾습니다. AI 검색은 거의 전적으로 후자에 가깝습니다. GEO 시대에 ‘키워드 채우기’가 더 이상 통하지 않는 이유입니다.
AI 검색은 임베딩 벡터로 콘텐츠를 어떻게 찾을까요?
사용자가 ChatGPT, Perplexity, Google AI Overviews에 질문하면 시스템은 다음 과정을 거칩니다. 먼저 질문을 임베딩 벡터로 변환합니다. 이어 콘텐츠 조각이 저장된 벡터 데이터베이스에서 의미상 가장 가까운 벡터를 비교해 관련 문단을 추출합니다. 마지막으로 이 조각들을 대규모 언어 모델에 전달하면, 모델이 답변을 구성하고 출처를 표시합니다. 이 전체 과정을 흔히 RAG(검색 증강 생성, Retrieval-Augmented Generation)라고 합니다.
핵심은 중간 단계인 검색입니다. 모델은 웹 전체를 읽고 답하는 것이 아니라, 먼저 벡터 거리를 기준으로 소수의 후보 콘텐츠를 추립니다. 내 페이지가 이 후보 목록에 들지 못하면 이후 생성 단계에서 아무리 잘 쓴 콘텐츠라도, 브랜드 규모가 아무리 크더라도 해당 답변과는 무관해집니다. GEO의 실질적인 목표는 바로 이 후보군에 진입할 자격을 얻는 것입니다.
- 사용자의 질문을 쿼리 벡터로 변환합니다.
- 벡터 데이터베이스에서 의미가 가장 가까운 콘텐츠 조각을 찾습니다.
- 가장 가까운 문단을 참고 자료로 언어 모델에 전달합니다.
- 모델이 해당 콘텐츠 조각을 바탕으로 답변을 생성하고 인용할 출처를 결정합니다.
좋은 콘텐츠인데도 AI가 찾지 못하는 이유
고객사의 GEO를 진단할 때 가장 자주 발견하는 문제는 분명합니다. Google 검색 순위와 검색 유입은 준수한데 AI 엔진의 인용은 거의 없는 경우입니다. 자세히 살펴보면 콘텐츠 자체의 품질보다 조각으로 나뉜 뒤 각 부분의 의미가 얼마나 완결되어 있는지가 문제인 경우가 많습니다. 벡터 검색은 글 전체를 한 번에 가져오지 않습니다. 섹션을 하나씩 나누고, 각 섹션을 별도의 벡터로 변환해 비교합니다.
핵심이 긴 설명 뒤에 숨어 있거나 한 문단에서 세 가지 주제를 동시에 다루면 해당 문단의 벡터는 의미가 모호해집니다. 어떤 명확한 질문과도 충분히 가까워지지 못해 검색 대상에 들기 어렵습니다. 반대로 처음부터 요점을 제시하고 하나의 질문에만 답하며, 문단만 따로 읽어도 뜻이 분명한 글은 벡터가 한곳에 집중됩니다. 특정 유형의 질문에서 선택될 가능성도 그만큼 높아집니다.
AI 검색은 글을 길게 썼다고 보상하지 않습니다. 짧은 문단마다 하나의 주제를 분명히 설명하고, 그 의미가 독립적으로 성립할 때 선택합니다.

벡터 검색에 잘 노출되는 콘텐츠 작성법
원리를 이해하면 실행 방법은 구체적입니다. 알고리즘의 비위를 맞출 필요는 없습니다. 각 문단의 의미를 명확하고 집중도 있게 다듬어 벡터 공간에서 분명한 위치를 차지하게 만들면 됩니다.
- 문단 하나에서는 질문 하나에만 답합니다. 결론을 문단 첫머리에 제시하고, 도입과 배경 설명은 뒤로 옮기거나 불필요하다면 삭제합니다.
- 제목과 도입부에는 사내 용어가 아니라 독자가 실제로 검색하거나 질문할 표현을 사용합니다. 벡터는 의미를 비교하므로 독자의 질문과 가까운 표현을 쓰면 의미상 거리를 줄일 수 있습니다.
- ‘직원 이직률’과 ‘인재 유지’처럼 유의어와 관련 표현을 문단에 자연스럽게 포함합니다. 하나의 문단이 더 다양한 질문과 연결될 수 있습니다.
- 각 문단만 따로 읽어도 의미가 통하도록 작성합니다. 앞뒤 문맥이 없어도 독자가 무엇을 설명하는지 이해할 수 있어야 합니다.
- 숫자, 정의, 단계는 가능한 한 구조화해 제시합니다. 이처럼 명확한 정보는 검색과 인용 과정에서 특히 선택되기 쉽습니다.
이 원칙들은 모두 같은 개념에서 출발합니다. AI 엔진은 글 전체가 아니라 조각 단위로 콘텐츠를 이해합니다. 따라서 콘텐츠의 최소 단위는 글 한 편이 아니라 문단입니다. 각 문단이 독립적으로 검색되고 인용될 수 있어야 합니다.
임베딩 벡터는 마케팅 용어가 아니라 AI 브랜드 노출의 기반입니다
GEO를 이름만 바꾼 SEO로 보고 키워드 밀도와 외부 링크 중심의 접근을 그대로 이어가는 경우가 많습니다. 그러나 AI 검색은 임베딩 벡터를 기반으로 콘텐츠를 찾습니다. 게임의 규칙이 달라진 것입니다. 콘텐츠가 발견되는지는 링크 그래프에서의 가중치가 아니라 의미 공간에서의 위치에 달려 있습니다. 이 차이를 이해해야 AI가 아예 참고하지 않는 지표에 시간과 자원을 낭비하지 않을 수 있습니다.



