GEO
返回博客
可见度衡量评估

AI 引用稳定性追踪:同一组问题,三个月后答案变了多少?

我们连续三个月,每周用同样的 40 个问题测试 ChatGPT、Perplexity 和 Gemini,发现其引用的品牌名单平均重合率仅约 55%。这项 AI 引用稳定性调研将告诉你:波动究竟有多大、哪些因素在推动变化,以及品牌如何提高被引用的概率。

Tenten GEO 团队发布于 2026-01-075 分钟阅读
深色背景中,同一组问题流向多个 AI 引擎,不断射出变化的光点,以表现信息来源的漂移。

同一个问题,今天问 ChatGPT,得到的品牌名单可能和三个月前有近一半不同。这不是错觉,也不是模型突然“变笨”了,而是生成式引擎的引用来源正在漂移,而且波动幅度足以改写采购决策中的候选名单。我们用整整一个季度追踪同一组问题,希望弄清楚这种波动到底有多大、由什么推动、是否存在规律。结论是:它比大多数品牌想象得更明显;与单次排名相比,引用稳定性也更能反映品牌在 AI 眼中的真实位置。

我们追踪了什么?

方法并不复杂。我们选取了 40 个 B2B 买家真实会问的问题,涵盖“最佳 XX 软件”“XX 工具”以及“XX 适合哪类团队”等典型搜索意图。随后连续三个月,每周使用完全相同的措辞向 ChatGPT、Perplexity 和 Gemini 提问,并记录每次答案中出现了哪些品牌、引用了哪些 URL,以及哪个品牌排在首位。

控制变量是这项调研能否成立的关键。我们使用相同的账号和地区设置,并关闭个性化记忆与搜索历史,尽量确保答案变化来自模型和信息来源本身,而不是我们的使用痕迹。问题措辞也始终保持不变,因为只要改动一个词,回答内容就可能不同;那将成为两个问题,而不再是同一问题的时间序列。

三个月后,答案发生了什么变化?

先说最反直觉的一点:波动并不只出现在冷门问题上。即使是“最佳项目管理软件”这类热门问题,AI 引用的品牌名单在三个月内也更换了近 40%。你以为自己一直守住了位置,实际曝光可能早已开始松动。

  • 月初与月末的品牌名单平均重合率约为 55%;换句话说,一个季度内,每三个被引用的品牌中就有一个被替换。
  • 约三分之一的问题中,排在首位的品牌在三个月内至少更换过一次。
  • Perplexity 的波动最明显,因为它高度依赖即时搜索结果;ChatGPT 对已经建立认知的品牌相对稳定,但同样会发生变化。
  • 长尾、探索型问题的品牌名单重排幅度,约为热门问题的两到三倍。
  • 结构清晰、定义明确、主题聚焦的新内容,上线两到三周后就可能进入引用名单。
与单次排名相比,引用稳定性更能反映品牌的真实地位。排名可能被一篇短期表现突出的文章推高;而稳定被引用,意味着模型反复判断你是可信的信息来源。Tenten GEO Brand Radar tracking observation
流向图显示,三个月内,AI 针对同一组问题引用的品牌名单持续变化,重合率约为 50%。
同一组问题连续追踪三个月、每周重复提问:AI 引用的品牌名单平均重合率仅约 55%。

为什么同一个问题会得到不同答案?

这种波动来自多个层面的变化。最底层是搜索:模型可能在回答前执行即时搜索或查询索引,而搜索结果本身每天都在重排——新页面进入、旧页面退出,入选内容随之改变。再上一层是模型更新:供应商每隔几周就可能微调权重与安全策略,同样的提示词因此可能触发不同的选择偏好。此外,生成过程本身具有随机性;即使前两个层面都没有变化,措辞和示例仍可能出现小幅波动。

还有一个容易被忽略的因素:竞争对手也在行动。对手发布一篇结构清晰、定义明确的对比文章后,可能在两到三周内取代你的位置。AI 的答案始终处于重新计算的动态平衡中,并不是一份最终确定的名单。

波动背后仍有规律可循

看似混乱的变化中,也存在可以预判的部分。知名度高、拥有第三方资料支撑的品牌,波动明显更小;只有自有页面提供信息的品牌,则最容易在名单重排中出局。搜索意图越清晰、答案共识越强,引用结果通常越稳定;问题越模糊、主观性越强、可选答案越多,名单的长尾波动就越明显。这意味着,品牌可以通过优化内容结构、积累外部专业背书,把自己推向波动更低、引用更稳定的一端。

品牌该如何应对这种不稳定?

最无效的做法,是每天反复检查 AI 答案,一看到自己的品牌掉出名单,就急着改动某篇文章。单日名单本来就会波动,基于单个时间点做决策,只会徒增成本。真正需要做的是延长追踪周期,结合引用次数、名单重合率等指标,判断品牌正走向稳定,还是在持续失去曝光。

提高稳定性的方向很明确:把核心主题写成定义清晰、有数据、有上下文的段落,让模型能够准确提取;在多个可信来源中保持一致的品牌实体信号;持续积累第三方引用与相互印证,让 AI 有更多理由将你判断为可信来源。这正是 Tenten Brand Radar 在做的事——持续监测品牌在各大生成式引擎中的引用轨迹,过滤单日噪声,将其转化为可供决策的趋势。

你无法让 AI 的答案停止波动,能做的是让自己的品牌成为难以替代的信息来源。如果你想了解品牌被引用得是否稳定、差距在哪里,可以预约一次 30 分钟的 GEO 诊断。我们会针对你的品牌跑一轮追踪,并直接用数据讨论结果。

常见问题

AI 引用的品牌名单,真的会在几个月内发生大幅变化吗?
会。我们连续三个月、每周追踪同一组问题,发现月初与月末被引用品牌的平均重合率仅约为 55%,相当于每三个被引用的品牌中就有一个被替换;即使是热门问题,也会出现这种变化。
为什么同一个问题会让 AI 给出不同的品牌答案?
因为答案背后存在多重变量:即时搜索结果每天都在重排,模型每隔几周可能更新一次,生成过程本身具有随机性,竞争对手也在持续发布新内容。因此,AI 答案是一种不断重新计算的动态平衡,而不是固定名单。
面对 AI 引用波动,应该如何追踪品牌表现?
不要只看单日结果,因为名单本来就会波动。应当延长追踪周期,结合引用次数和名单重合率等指标,判断品牌正走向稳定还是持续流失;同时,把新内容上线后的两到三周作为关键观察窗口。

准备好了吗

你的品牌在 AI 答案中有多高的可见度?

通过 30 分钟 GEO 诊断,了解品牌在主要 AI 引擎中的可见度缺口,以及应该优先解决的问题。

预约 30 分钟诊断