我曾在 ChatGPT 里随手问了一句:“推荐几家台湾的 SaaS 顾问公司。”看到自己的名字出现在回答里,我顿时松了口气。但这不是审计,只是碰运气。换个账号、关闭记忆,第二天再问同一句话,答案很可能就变了。真正的审计不看“有没有被提到”,而要看在固定条件下,品牌被提及的频率、出现的顺序,以及是否附有可点击的来源链接。只有把这 3 项量化,才能称为审计。
先分清“引用”的 3 个等级
很多人会把 3 种完全不同的情况混为一谈,导致审计结果失真。第一种是模型在生成的文本中提到你的品牌,但没有链接;第二种是 Perplexity,或开启搜索功能的 ChatGPT,在回答旁列出来源卡片,用户可以点击进入你的网站;第三种是用户要求“推荐一家公司”时,模型直接把你列为首选。这 3 种情况的商业价值差别很大,审计时必须分开记录。
- 纯文本提及:品牌名称出现在回答中,但没有链接,也不代表任何排名。这只是基础曝光,很容易被竞品稀释。
- 来源引用:回答旁出现你的网站 URL 卡片,用户可以点击访问。这才是 GEO 真正需要争取的位置。
- 首选推荐:当用户要求“只推荐一家公司”时,模型首先提到你,或者整段回答只介绍你。这是审计中最少见、也最有价值的信号。
开始提问前,先固定 4 个变量
审计就像做实验。变量不固定,数据就没有意义。今天用登录账号提问,明天又换成无痕窗口,模型可调用的个性化记忆不同,结果自然无法比较。正式审计前,先明确并记录以下 4 项。
- 账号与记忆:始终保持未登录状态或使用无痕模式,并关闭 ChatGPT 的“引用聊天记录”功能,排除个性化信息对结果的干扰。
- 平台与模式:分别测试 ChatGPT(包括搜索模式)、Perplexity、Google AI Overviews 和 Gemini,各自记录,不能混在一起。
- 语言与地区:使用目标客户的语言提问。例如面向台湾 B2B 市场时,应使用繁体中文;英文提问得到的结果不能代表台湾市场。
- 提问时间:尽量在同一天完成同一批提示词。模型索引和实时检索结果每天都会变化,跨周数据不具备可比性。
提示词模板:5 类提问方式,可直接复制
只问一个问题,看不到全貌。真实用户会从不同角度表达同一种需求:有人从品类入手,有人直接点名比较,也有人带着具体场景提问。下面 5 类提示词覆盖了买家从“还不知道你”到“已经在考虑你”的完整旅程。只需把 [品类]、[品牌]、[场景] 替换成自己的内容。
- 品类探索型:“我想找[品类,例如台湾的 B2B GEO/SEO 服务商],请推荐几家,并说明各自擅长什么。”观察你的品牌能否进入未点名推荐名单。
- 点名比较型:“与[主要竞品]相比,[你的品牌]在[服务项目]上有什么区别?”观察模型是否认识你的品牌,以及给出的信息是否准确。
- 场景需求型:“我是一家[行业] SaaS 公司,希望提升在 AI 搜索中的品牌曝光,应该找谁、从哪里开始?”观察模型是否会把你的品牌带入解决方案。
- 事实核查型:“[你的品牌]提供哪些服务?价格和服务范围是什么?”检查模型给出的内容是否准确、是否已经过时。
- 来源请求型:“请推荐[品类],并附上你参考的来源 URL。”明确要求模型提供来源引用,检查你的网站是否获得外链。
ChatGPT 和 Perplexity 要分开评估
两者的引用机制不同。Perplexity 的回答几乎都会附带来源编号,审计时可以直接统计你的网站出现在哪些回答中、被引用了多少次,信号非常清晰。ChatGPT 则要区分纯模型回答和开启搜索后的回答:前者依赖训练数据与模型记忆,能否提到你取决于长期积累的品牌声誉;后者会实时检索网页并附上链接,更接近 Perplexity。测试 ChatGPT 时,同一个问题应分别在两种模式下各问一次。两者之间的差距,本身就是有价值的洞察。

把回答转成分数:一张表就够了
问完以后不要凭印象判断。新建一张表,横向列出 4 个平台,纵向列出 5 类提示词,每个单元格只记录 3 项信息。等这张表跑到第 2 次、第 3 次,你看到的就不再是单个结果,而是变化趋势。
- 是否提及(0 或 1):这个单元格对应的回答中是否出现了你的品牌?
- 引用等级(1 至 3):纯文本提及记 1 分,附来源链接记 2 分,列为首选记 3 分。
- 竞品覆盖情况:同一单元格中还出现了哪些竞品,它们排在你之前还是之后。
从审计缺口反推需要修复的问题
审计的价值,在于把问题落到具体行动,而不是给出“多写几篇文章”之类的模糊建议。如果连纯文本提及都没有,问题很可能是品牌的讨论密度太低,需要补充外部证据和品牌曝光机会。如果有提及,却几乎没有来源引用,通常说明页面内容不便于提取:缺少清晰的问答结构,没有结构化数据,关键事实还藏在图片或冗长段落中。前者是品牌声量问题,后者是技术结构问题,需要用完全不同的方法解决。
自己完整跑一轮审计,大约半天就能判断缺口究竟在品牌声量还是内容结构。如果你需要更完整的版本,把 20 个单元格的结果、竞品对比和具体修复清单系统整理出来,Tenten GEO 的 30 天 GEO 审计就是对这套流程的深入执行。如果想先确认自己的差距在哪里,可以预约一次 30 分钟的 GEO 诊断,我们会直接用你的品牌进行几轮实际提问。



