Tenten AIGEO
블로그로 돌아가기
가시성 측정검토

AI 인용 안정성 추적: 같은 질문에 대한 답변은 3개월 동안 얼마나 달라졌을까?

3개월 동안 매주 같은 질문 40개를 ChatGPT, Perplexity, Gemini에 입력해 추적한 결과, 인용된 브랜드 목록의 평균 중복률은 약 55%에 불과했습니다. 이 AI 인용 안정성 조사를 통해 변동 폭과 원인, 브랜드가 인용 가능성을 높이는 방법을 살펴봅니다.

Tenten GEO 팀게시일 2026-01-075 분 소요
어두운 배경에서 같은 질문 묶음이 여러 AI 엔진으로 흘러 들어가고, 출처의 이동을 나타내듯 계속 달라지는 빛의 점들이 쏟아져 나오는 모습

오늘 ChatGPT에 같은 질문을 해도 3개월 전과 비교하면 브랜드 목록의 절반 가까이가 달라질 수 있습니다. 착각도 아니고 모델의 성능이 갑자기 나빠진 것도 아닙니다. 생성형 엔진이 참고하는 출처가 이동하기 때문입니다. 그 변동 폭은 구매 후보군 자체를 바꿀 만큼 큽니다. 우리는 한 분기 동안 같은 질문 묶음을 추적하며 변동 폭과 대상, 일정한 패턴이 있는지를 살펴봤습니다. 결론부터 말하면 변동성은 대부분의 브랜드가 생각하는 것보다 훨씬 큽니다. 또한 AI가 브랜드를 실제로 어떻게 평가하는지 파악하려면 한 번의 순위보다 지속적인 추적이 더 유용합니다.

무엇을 추적했나?

조사 방식은 간단합니다. B2B 구매자가 실제로 검색할 법한 “최고의 XX 소프트웨어”, “XX 도구”, “어떤 팀에 적합한 XX인가” 유형의 질문 40개를 선정했습니다. 이후 3개월 동안 매주 같은 문구를 ChatGPT, Perplexity, Gemini에 입력하고, 답변에 등장한 브랜드와 인용된 URL, 첫 번째로 제시된 브랜드를 기록했습니다.

이 조사에서 핵심은 변수를 통제하는 것입니다. 동일한 계정과 지역 설정을 사용하고 개인 메모리와 검색 기록을 껐습니다. 답변의 변화가 사용자의 흔적이 아니라 모델과 출처 자체에서 비롯되도록 하기 위해서입니다. 질문 문구도 완전히 고정했습니다. 단어 하나만 달라져도 결과가 바뀔 수 있으며, 그러면 시계열 비교가 아니라 서로 다른 두 질문을 비교하게 됩니다.

3개월 뒤, 답변은 달라졌다

가장 의외였던 점부터 살펴보겠습니다. 변동성은 관심이 적은 질문에만 나타나지 않았습니다. “최고의 프로젝트 관리 소프트웨어”처럼 수요가 많은 질문에서도 인용 브랜드 목록의 약 40%가 3개월 사이 교체됐습니다. 자리를 지키고 있다고 생각하는 동안 실제 노출은 이미 약해지고 있을 수 있습니다.

  • 월초와 월말의 인용 브랜드 목록을 비교한 평균 중복률은 약 55%였습니다. 다시 말해 한 분기 안에 인용 브랜드 3개 중 1개가 교체됐습니다.
  • 전체 질문의 약 3분의 1에서는 3개월 동안 첫 번째로 제시되는 브랜드가 최소 한 번 바뀌었습니다.
  • 실시간 검색 결과에 크게 의존하는 Perplexity의 변동성이 가장 컸습니다. 기존에 자리 잡은 브랜드를 제시하는 경향은 ChatGPT가 비교적 안정적이었지만, 이 역시 변화했습니다.
  • 롱테일이거나 의도가 덜 명확한 질문은 인기 질문보다 브랜드 목록이 약 2~3배 더 자주 바뀌었습니다.
  • 구조가 명확하고 정의가 분명한 새 콘텐츠는 게시 후 2~3주 만에 인용 목록에 진입할 수 있었습니다.
인용 안정성은 한 번의 순위보다 실제 위상을 더 잘 보여줍니다. 짧은 글 하나로 일시적으로 순위가 오를 수는 있지만, 꾸준히 인용된다는 것은 여러 모델이 반복해서 해당 브랜드를 신뢰할 만한 출처로 판단했다는 의미입니다.Tenten GEO Brand Radar tracking observation
같은 질문 묶음에서 AI가 인용한 브랜드 목록이 3개월 동안 계속 바뀌었으며 중복률이 약 50%였음을 보여주는 흐름도
같은 질문을 3개월 동안 매주 반복한 결과, 인용된 브랜드 목록의 평균 중복률은 약 55%에 그쳤습니다.

같은 질문에 왜 다른 답변이 나올까?

변동은 여러 층위에서 발생합니다. 가장 아래에는 검색이 있습니다. 모델은 답변 전에 실시간으로 검색하거나 검색 색인을 조회하는데, 검색 결과 자체가 매일 재정렬됩니다. 새 페이지가 들어오고 기존 페이지가 밀려나면서 선택되는 콘텐츠도 달라집니다. 그 위에는 모델 업데이트가 있습니다. 공급사는 몇 주 간격으로 가중치와 안전 정책을 조정하며, 같은 프롬프트라도 콘텐츠 선택 기준이 달라질 수 있습니다. 여기에 생성 과정의 무작위성도 더해집니다. 앞선 두 조건이 그대로여도 표현과 예시는 조금씩 달라질 수 있습니다.

놓치기 쉬운 요인이 하나 더 있습니다. 경쟁사도 계속 움직입니다. 경쟁사가 구조가 명확하고 정의가 분명한 비교 콘텐츠를 발행하면 2~3주 안에 기존 브랜드의 자리를 차지할 수 있습니다. AI 답변은 확정된 최종 목록이 아니라 계속 다시 계산되는 균형점입니다.

변동 속에도 패턴은 있다

혼란스러워 보이는 변화에도 예측 가능한 부분은 있습니다. 인지도가 높고 제3자 출처의 뒷받침을 받는 브랜드는 변동 폭이 확실히 작았습니다. 반면 자체 페이지와 소개 자료에만 의존하는 브랜드는 목록에서 가장 쉽게 밀려났습니다. 검색 의도가 분명하고 일반적인 답이 존재하는 질문일수록 결과가 안정적이었습니다. 질문이 모호하고 범위가 넓으며 선택지가 많을수록 변동은 더 오래 이어졌습니다. 즉, 콘텐츠 구조를 개선하고 외부의 전문적 근거를 확보하면 브랜드를 변동이 적고 안정적으로 인용되는 쪽으로 이동시킬 수 있습니다.

브랜드는 이 불안정성에 어떻게 대응해야 할까?

가장 효과가 낮은 대응은 매일 AI 답변을 확인하다가 목록에서 빠질 때마다 콘텐츠 하나를 급히 손보는 것입니다. 일별 목록은 원래 흔들리므로 한 시점만 보고 내린 결정은 시간과 비용만 소모할 수 있습니다. 필요한 것은 추적 기간을 늘리고, 인용 횟수와 목록 중복률 같은 지표를 활용해 안정되는 추세인지 지속적으로 하락하는지 판단하는 일입니다.

안정성을 높이는 방향은 분명합니다. 핵심 주제를 명확하고 수치화된 맥락 중심의 문단으로 작성해 모델이 내용을 정확히 추출할 수 있게 해야 합니다. 여러 신뢰도 높은 출처에서 일관된 브랜드 엔터티 신호를 유지하고, 제3자의 인용과 교차 검증 자료를 축적해 AI가 해당 브랜드를 신뢰할 만한 출처로 판단할 근거를 늘려야 합니다. Tenten의 Brand Radar가 하는 일도 바로 이것입니다. 여러 주요 생성형 엔진에서 브랜드의 인용 추이를 지속적으로 모니터링하고, 하루짜리 변동을 걸러내 의사결정에 활용할 수 있는 추세로 바꿉니다.

AI 답변을 안정시킬 수는 없습니다. 대신 쉽게 대체되지 않는 출처가 될 수는 있습니다. 브랜드가 얼마나 안정적으로 인용되고 있는지, 어디에 공백이 있는지 확인하고 싶다면 30분 GEO 진단을 예약해 보세요. 귀사의 브랜드를 직접 추적하고 데이터를 바탕으로 결과를 설명해 드립니다.

자주 묻는 질문

AI가 인용하는 브랜드 목록은 몇 달 사이에 정말 크게 달라지나요?
그렇습니다. 같은 질문 묶음을 3개월 동안 매주 추적한 결과, 월초와 월말에 인용된 브랜드 목록의 평균 중복률은 약 55%에 그쳤습니다. 인용 브랜드 3개 중 1개가 교체된 셈이며, 관심이 많은 질문도 예외가 아니었습니다.
같은 질문인데도 AI가 다른 브랜드를 제시하는 이유는 무엇인가요?
여러 변수가 동시에 작용하기 때문입니다. 실시간 검색 결과는 매일 재정렬되고 모델은 몇 주 간격으로 업데이트됩니다. 생성 과정 자체에도 무작위성이 있으며, 경쟁사 역시 새 콘텐츠를 계속 발행합니다. 따라서 AI 답변은 고정된 목록이 아니라 매번 다시 계산되는 결과에 가깝습니다.
AI 인용 변동성이 큰 상황에서 브랜드 노출은 어떻게 추적해야 하나요?
변동성이 큰 하루치 결과만 봐서는 안 됩니다. 추적 기간을 늘리고 인용 횟수와 목록 중복률을 함께 살펴, 브랜드 노출이 안정되는지 계속 감소하는지 판단해야 합니다. 새 콘텐츠는 게시 후 2~3주를 핵심 관찰 기간으로 삼는 것이 좋습니다.

다음 단계

AI 답변에서 우리 브랜드는 얼마나 보일까요?

30분 GEO 진단을 통해 주요 AI 엔진에서의 가시성 격차와 우선 개선 과제를 확인해 보세요.

30분 진단 예약