同一个问题,今天问 ChatGPT,得到的品牌名单可能和三个月前有近一半不同。这不是错觉,也不是模型突然“变笨”了,而是生成式引擎的引用来源正在漂移,而且波动幅度足以改写采购决策中的候选名单。我们用整整一个季度追踪同一组问题,希望弄清楚这种波动到底有多大、由什么推动、是否存在规律。结论是:它比大多数品牌想象得更明显;与单次排名相比,引用稳定性也更能反映品牌在 AI 眼中的真实位置。
我们追踪了什么?
方法并不复杂。我们选取了 40 个 B2B 买家真实会问的问题,涵盖“最佳 XX 软件”“XX 工具”以及“XX 适合哪类团队”等典型搜索意图。随后连续三个月,每周使用完全相同的措辞向 ChatGPT、Perplexity 和 Gemini 提问,并记录每次答案中出现了哪些品牌、引用了哪些 URL,以及哪个品牌排在首位。
控制变量是这项调研能否成立的关键。我们使用相同的账号和地区设置,并关闭个性化记忆与搜索历史,尽量确保答案变化来自模型和信息来源本身,而不是我们的使用痕迹。问题措辞也始终保持不变,因为只要改动一个词,回答内容就可能不同;那将成为两个问题,而不再是同一问题的时间序列。
三个月后,答案发生了什么变化?
先说最反直觉的一点:波动并不只出现在冷门问题上。即使是“最佳项目管理软件”这类热门问题,AI 引用的品牌名单在三个月内也更换了近 40%。你以为自己一直守住了位置,实际曝光可能早已开始松动。
- 月初与月末的品牌名单平均重合率约为 55%;换句话说,一个季度内,每三个被引用的品牌中就有一个被替换。
- 约三分之一的问题中,排在首位的品牌在三个月内至少更换过一次。
- Perplexity 的波动最明显,因为它高度依赖即时搜索结果;ChatGPT 对已经建立认知的品牌相对稳定,但同样会发生变化。
- 长尾、探索型问题的品牌名单重排幅度,约为热门问题的两到三倍。
- 结构清晰、定义明确、主题聚焦的新内容,上线两到三周后就可能进入引用名单。
与单次排名相比,引用稳定性更能反映品牌的真实地位。排名可能被一篇短期表现突出的文章推高;而稳定被引用,意味着模型反复判断你是可信的信息来源。— Tenten GEO Brand Radar tracking observation

为什么同一个问题会得到不同答案?
这种波动来自多个层面的变化。最底层是搜索:模型可能在回答前执行即时搜索或查询索引,而搜索结果本身每天都在重排——新页面进入、旧页面退出,入选内容随之改变。再上一层是模型更新:供应商每隔几周就可能微调权重与安全策略,同样的提示词因此可能触发不同的选择偏好。此外,生成过程本身具有随机性;即使前两个层面都没有变化,措辞和示例仍可能出现小幅波动。
还有一个容易被忽略的因素:竞争对手也在行动。对手发布一篇结构清晰、定义明确的对比文章后,可能在两到三周内取代你的位置。AI 的答案始终处于重新计算的动态平衡中,并不是一份最终确定的名单。
波动背后仍有规律可循
看似混乱的变化中,也存在可以预判的部分。知名度高、拥有第三方资料支撑的品牌,波动明显更小;只有自有页面提供信息的品牌,则最容易在名单重排中出局。搜索意图越清晰、答案共识越强,引用结果通常越稳定;问题越模糊、主观性越强、可选答案越多,名单的长尾波动就越明显。这意味着,品牌可以通过优化内容结构、积累外部专业背书,把自己推向波动更低、引用更稳定的一端。
品牌该如何应对这种不稳定?
最无效的做法,是每天反复检查 AI 答案,一看到自己的品牌掉出名单,就急着改动某篇文章。单日名单本来就会波动,基于单个时间点做决策,只会徒增成本。真正需要做的是延长追踪周期,结合引用次数、名单重合率等指标,判断品牌正走向稳定,还是在持续失去曝光。
提高稳定性的方向很明确:把核心主题写成定义清晰、有数据、有上下文的段落,让模型能够准确提取;在多个可信来源中保持一致的品牌实体信号;持续积累第三方引用与相互印证,让 AI 有更多理由将你判断为可信来源。这正是 Tenten Brand Radar 在做的事——持续监测品牌在各大生成式引擎中的引用轨迹,过滤单日噪声,将其转化为可供决策的趋势。
你无法让 AI 的答案停止波动,能做的是让自己的品牌成为难以替代的信息来源。如果你想了解品牌被引用得是否稳定、差距在哪里,可以预约一次 30 分钟的 GEO 诊断。我们会针对你的品牌跑一轮追踪,并直接用数据讨论结果。

