AI 검색은 답변하기 전에 웹 전체를 읽지 않습니다. 먼저 벡터 검색으로 인덱스에서 관련성이 가장 높은 문단 10여 개를 가져온 뒤, 이 문단만 언어 모델에 전달해 답변을 생성합니다. 여기서 다소 직관에 반하는 결론이 나옵니다. AI의 인용 여부를 좌우하는 것은 웹페이지의 기존 검색 순위가 아니라, 특정 문단이 따로 추출되어도 독립적으로 이해될 수 있는지입니다.
AI 검색의 이면에서 진행되는 4단계
질문을 전송한 순간부터 답변이 나타날 때까지는 크게 쿼리 이해, 검색, 재순위화, 생성의 4단계를 거칩니다. 단계마다 일부 콘텐츠가 후보에서 제외됩니다. 마지막까지 살아남아야 비로소 답변에 포함될 수 있습니다. 많은 사람이 최종 답변의 형태에만 주목하지만, 실제로 후보 진입 여부를 결정하는 것은 앞선 3단계입니다.
- 쿼리 이해와 재작성: 모델은 일상적인 표현으로 작성된 질문을 분해하고, 빠진 맥락을 보완하거나 여러 하위 쿼리로 다시 작성해 모호하거나 다의적인 질문을 처리합니다.
- 검색: 시스템은 쿼리를 벡터로 변환한 뒤 인덱스에서 의미가 가장 가까운 텍스트 구간 수십 개를 찾습니다. 이 단계에서 후보군의 범위가 결정됩니다.
- 재순위화: 더 정교한 모델로 후보 문단의 점수를 다시 산정해 질문에 답할 가능성이 가장 높은 문단을 상위에 배치합니다.
- 생성: 언어 모델은 최종 선정된 문단만 읽어 하나의 답변으로 종합하고, 인용을 지원하는 인터페이스에서는 출처를 표시합니다.
임베딩: ‘의미’를 좌표로 바꾸는 기술
검색의 핵심은 임베딩입니다. 시스템은 각 텍스트를 숫자의 나열, 즉 벡터로 변환해 고차원 공간에 배치합니다. 의미가 비슷한 콘텐츠는 가까운 좌표에 놓입니다. ‘요금제 해지’와 ‘구독 취소’는 표면적인 단어가 다르지만 벡터는 거의 겹칩니다. 사용자의 질문 역시 벡터로 변환되므로 검색은 결국 기하학 문제로 바뀝니다. 공간에서 질문과 가장 가까운 점을 찾는 것입니다.
AI 검색에서 키워드 반복의 효과가 제한적인 이유도 여기에 있습니다. 모델은 문자열의 완전한 일치 여부가 아니라 의미적 거리를 비교합니다. 주제를 빠짐없이 설명하고, 개념 간 관계를 명확히 드러내며, 텍스트가 의미 공간에서 선명한 위치를 차지하도록 만드는 편이 훨씬 중요합니다.
RAG: 모델은 ‘기억한 것’이 아니라 ‘찾은 것’으로 답합니다
현재 주류 AI 검색은 대부분 RAG(Retrieval Augmentation Generation)를 기반으로 합니다. 모델이 매개변수에 저장한 기억만으로 답하면 정보가 오래되거나 사실과 다른 내용을 만들어낼 수 있습니다. 그래서 시스템은 답변 직전에 관련 문서를 검색해 컨텍스트에 넣고, 모델이 해당 자료를 바탕으로 답하도록 합니다. Perplexity와 AI Overviews가 출처 링크를 함께 제시하는 이유도 답변이 검색된 문서에서 만들어지기 때문입니다.

AI Overviews, ChatGPT, Perplexity는 실제로 서로 다릅니다
같은 RAG를 사용하더라도 구현 방식은 크게 다릅니다. Google AI Overviews는 기존 검색 인덱스와 연결되어 있습니다. 후보 출처는 대체로 이미 검색 순위에 오른 웹페이지이며, Gemini가 이를 요약하고 선별합니다. Perplexity는 실시간 검색과 관련도 순위에 더 무게를 두기 때문에 출처 범위가 넓고 최신성이 높습니다. ChatGPT는 상황에 따라 다릅니다. 검색 기능이 켜져 있으면 웹을 검색하지만, 꺼져 있으면 학습 과정에서 얻은 기억을 바탕으로 답합니다. 후자의 경우 정보가 오래되거나 내 콘텐츠가 누락되기 쉽습니다. 이러한 차이를 알아야 어디에 최적화 역량을 집중할지 판단할 수 있습니다.
작동 원리를 알았다면 콘텐츠는 어떻게 써야 할까?
앞서 살펴본 4단계를 거꾸로 따라가면 최적화 방향이 선명해집니다. 콘텐츠는 검색 후보에 포함되는 동시에 생성 단계에서도 선택되어야 합니다. 전자에는 완결된 의미와 기술적인 크롤링 가능성이 필요하고, 후자에는 문단의 독립성, 명확한 답변, 신뢰할 수 있는 출처가 필요합니다. 서로 다른 단계의 요건이므로 어느 하나라도 빠지면 답변에 포함되기 어렵습니다.
- 각 문단은 앞뒤 맥락 없이도 독립적으로 이해되어야 합니다. 검색 과정에서는 문단 하나만 따로 추출되는 경우가 많기 때문입니다.
- 질문과 답변을 곧바로 연결합니다. 결론을 먼저 제시하고 근거를 이어서 설명하면 모델이 글의 의도를 추측할 필요가 없습니다.
- 형용사 대신 구체적인 숫자, 정의, 절차를 사용합니다. 검증 가능한 콘텐츠일수록 신뢰받고 인용되기 쉽습니다.
- 의미의 초점을 유지합니다. 한 페이지에서 하나의 주제를 명확히 설명해 벡터가 모호한 영역에 놓이지 않도록 합니다.
- AI 크롤러가 기술적으로 콘텐츠를 읽을 수 있어야 합니다. robots 설정, 구조화 데이터, 렌더링 방식까지 함께 점검해야 합니다.
AI 검색의 모든 단계는 필터링 과정입니다. 콘텐츠가 실제로 노출되려면 생성되는 마지막 순간까지 살아남아야 합니다. 많은 B2B 웹사이트는 인덱싱되기도 전에 막힙니다. 콘텐츠 자체가 나빠서가 아니라 문단 구조와 기술 설정 때문에 엔진이 내용을 명확히 읽지 못하는 경우가 많습니다. 이 과정에서 콘텐츠가 어느 지점에서 탈락하는지 알고 싶다면 30분 GEO 진단을 예약해 보세요. AI 브랜드 노출 모니터링을 통해 여러 AI 엔진에서의 인용 현황을 직접 점검합니다.



