用一句话概括 Brand Radar:把 AI 引擎视为一个每次都可能给出不同答案的系统,反复提交相同问题,统计品牌被提及和引用的概率。它不查关键词排名,也不看网站流量,而是衡量“当潜在客户向 AI 寻找服务商时,你出现得有多频繁、获得了多少信任”。整套方法能否成立,关键在于采样设计,而不只是背后的技术。
首先要明确:Brand Radar 究竟在测量什么?
传统 SEO 工具可以告诉你某个网址在 Google 排第几,但 AI 引擎没有固定名次。你向 ChatGPT 提问:“台湾有哪些服务 B2B SaaS 的 GEO 代理商?”今天的答案可能列出三家,明天可能变成五家,顺序也会变化。因此,可见性不能用一次排名来表达,只能理解为“经过大量重复查询后,品牌进入答案的概率”。Brand Radar 会把这一概率拆解为可量化指标:提及率、引用率、平均位置、情感倾向,以及竞争声量。
Step 1:把买家的真实问题整理成提示词库
这一阶段最常见的错误,是从品牌希望被搜索的关键词出发。买家不会直接搜索“GEO 审计服务”,他们更可能问:“AI 搜索从来不提我们公司,该找谁解决?”或者“怎么判断 ChatGPT 有没有推荐我的产品?”我们通常从三个来源构建提示词库:业务团队实际收到的客户问题、客户访谈与销售对话中的原话,以及不同 AI 引擎给出的延伸提问和建议。样本量要足以形成稳定比例,但并非越大越好;过多提示词反而会稀释真正的业务问题。对潜在客户较少的 B2B 品类来说,通常抓取 40 到 120 个核心提示词就足以覆盖认知、比较和决策阶段。重点是,每个提示词都必须对应真实的采购场景。
Step 2:为什么必须反复采样?
AI 引擎的回答具有随机性。同一个问题交给同一个模型运行十次,可能出现八种不同表述,排序也各不相同。只运行一次,得到的是一条信息,而不是可用的信号。Brand Radar 会在每个引擎上重复运行每条提示词,再分析统计分布。假设品牌在十次回答中出现七次,提及率就是 70%,这个数字才具备参考价值。采样还必须覆盖多个引擎,因为 ChatGPT、Perplexity、Gemini 和 Google AI Overviews 对信息来源的偏好差异很大,同一品牌在不同引擎中的可见性可能相去甚远。
Step 3:获取回答,并区分“提及”与“引用”
每一条采样回答都要从两个维度判断。第一是提及:品牌名、产品名或关键人物是否出现在回答正文中?第二是引用:回答中的来源链接、脚注或参考资料列表是否指向品牌网站?两者经常被混为一谈,但含义完全不同。正文提及说明模型“记得”这个品牌;来源引用则说明在这次查询中,品牌内容被当作证据使用。健康的品牌可见性应同时具备两者。如果只有提及、没有引用,通常意味着品牌仍在依赖过去积累的知名度,但现有内容的证据覆盖不足。识别环节还有一个陷阱:品牌名可能被误判,同名公司可能混入结果,模型也可能拼错名称或只说出一部分。因此,必须建立清晰的消歧规则,把真正与品牌有关的内容和同名信息区分开,否则后续评分都会失真。

Step 4:如何计算可见性评分?
完成提及与引用数据清洗后,就可以将结果转化为可追踪的分数。核心逻辑是加权计算,而不是简单相加:
- 提及率:在全部采样结果中,品牌出现在回答正文里的比例。
- 引用率:在带有来源的回答中,来源指向品牌网站的比例,反映品牌内容被当作证据采用的程度。
- 位置:品牌是在回答前段出现,还是仅在靠后位置被顺带提到?
- 情感倾向:AI 对品牌的描述是正面、中性还是负面,这会直接影响曝光的实际价值。
- 声量占比:在同一组提示词下,将品牌与主要竞争对手比较,判断谁更经常被 AI 选入答案。
这些指标还要结合提示词的商业价值进行加权。处于决策阶段、采购意图明确的问题,应当比泛认知问题获得更高权重。最终可以汇总成一个便于沟通的可见性评分,但真正用于决策的,往往是各项明细,因为它们对应不同的改进方向:提及率或引用率偏低,需要补充内容与结构化证据;声量占比落后,则应优先覆盖竞争对手经常被引用的主题。
Step 5:把单次快照转化为长期趋势
某一时点的分数只能说明现状,无法解释原因或效果。可见性必须持续监测:按照固定的每周周期重新运行同一批提示词,并将分数绘制成时间序列,才能把“我们上个月新增了三篇对比文章”与“两周后 Perplexity 的引用率开始上升”联系起来。趋势也能更早暴露风险。如果某个竞争对手的声量连续三次上升,并不断挤占原本属于你的答案位置,这个信号往往会先于网站流量变化出现。
这些数字在实际工作中应该怎么用?
可见性评分不是用于汇报的虚荣指标。它真正要回答的是:下一篇内容应该写什么,哪个引擎存在最关键的覆盖缺口,以及投入的资源是否确实让品牌更频繁地进入 AI 回答。
走完整套 Brand Radar 逻辑就会发现,它本质上是把成熟的测量方法应用到不断变化的 AI 引擎矩阵中。难点不在于抓取数据,而在于选对提示词、清洗识别结果,并把评分重新对应到可执行的动作。如果你还不清楚品牌在主要 AI 引擎中的提及和引用表现,也不知道差距卡在哪里,可以预约一次 30 分钟的 GEO 诊断。我们会选取一组与你业务类型相关的真实问题进行测试,梳理可见性流失点和优先补强项。


