ChatGPT 并不会像浏览器那样“阅读”你的网页。它会从自己的搜索索引中检索能够被清晰引用的事实片段,再将这些内容组织成答案。结构化数据与实体标记的价值,不是帮你“提升排名”,而是让机器不必猜测:产品叫什么、属于什么类别、由谁提供、解决什么问题。把这些信息写成机器可读的形式,模型才能准确理解。如果缺少这一层,ChatGPT 只能根据散落在页面各处的文字自行推断;一旦推断出错,引用也会跟着出错。
ChatGPT 读取事实,而不是页面布局
先弄清楚 ChatGPT 如何获取你的内容。当用户在 ChatGPT 中触发搜索时,OpenAI 的 OAI-SearchBot 会抓取页面 HTML,并结合现有的网站索引筛选多个信源,再交给模型生成答案。这个过程有两个现实限制。第一,它拿到的主要是初始 HTML,许多依赖浏览器端 JavaScript 才能呈现的内容往往无法被抓取;第二,模型需要的不是你精心设计的版式,而是可以用一句话提取并直接引用的事实。JSON-LD 等结构化数据可以明确写出:“这是一个产品,名称为……”
需要说清楚的是:结构化数据并不是获得引用的魔法开关。我们为 B2B SaaS 客户开展 GEO 审计时发现,Schema 本身很少直接决定“能否被引用”,但几乎决定了“被引用时,事实是否准确”。如果你在页面可见文字中清楚陈述同一组事实,再用 JSON-LD 标记一次,就相当于给模型提供了两条相互印证的线索。反过来,如果只做标记,正文却含糊不清,效果就会大打折扣。
最小可行配置:先做好三类 Schema
没有必要一次性把 schema.org 的所有类型都加上。要让 ChatGPT 读懂一个 B2B 产品,先正确配置以下三类标记,就能覆盖 80% 的效果。
- Organization:放在网站首页,或作为全站共用标记。写清品牌全称、Logo、官方网站,以及最重要的 sameAs——用它关联 LinkedIn、Crunchbase、Wikidata(维基数据)等权威页面。这是模型识别“你是谁”的锚点。
- Product 或 SoftwareApplication:放在产品页面。填写 name、description、brand 和 offers(价格或套餐);如果确有真实评价,再添加 aggregateRating,没有就不要填写。
- FAQPage:放在产品页面或说明页面,用真实的问答呈现用户最常问的 3 至 5 个问题。这是 ChatGPT 最容易直接提取为答案的格式,因为问题与回答天然构成了清晰的对应关系。
这三类标记都应通过 JSON-LD 写入页面。不要再使用早期那种分散嵌入 HTML 标签的 Microdata,因为维护成本高,也更容易出错。每段 JSON-LD 都必须与页面上的可见内容一致:标记中写了评分,页面上就必须确实展示评分;标记中的套餐价格也必须与产品页面一致。标记与正文不一致,不仅会导致标记失效,还可能被判定为操纵行为。
实体标记才是真正的杠杆
很多人做到 Product 结构化数据就停下了。但要让 ChatGPT 真正“认出”你的品牌,而不只是“读到”你的某个页面,关键还在实体层。实体标记的核心任务是消歧:市场上叫“Radar”的产品有几十个,你必须让模型 100% 确定,它引用的是你的产品,而不是另一家同名公司的产品。没有消歧,内容做得再多,也只会留下归属模糊的印象,甚至为别人积累认知。
具体做法有三个支点。第一,命名必须一致:官方网站、社交账号、目录和新闻稿中的品牌全称要一字不差,不要一处写“Tenten GEO”,另一处又写“Tenten”。第二,用 @id 建立实体图谱:为 Organization 设置稳定的 @id(例如 https://yoursite.com/#organization),再让产品的 brand 和文章的 publisher 都指向同一个 @id。这样,模型才能把分散在不同页面上的事实串联到同一个实体。第三,通过 sameAs 连接外部权威信源,尤其是 Wikidata——这是许多 AI 系统共用的实体数据库。被其收录,相当于获得一张跨平台的身份凭证。

别把爬虫挡在门外
标记写得再完善,爬虫进不来也是徒劳。这一步最容易被忽略,却也最容易引发问题。
- 在 robots.txt 中放行:确认没有屏蔽 OAI-SearchBot(用于 ChatGPT 搜索)和 GPTBot(用于 OpenAI 抓取)。一边希望获得引用,一边同时拦截这两个爬虫,是我们在审计中最常见的自我设限。
- 关键内容必须能从初始 HTML 中读取:如果产品说明完全依赖前端 JavaScript 渲染,爬虫很可能只能读到空白内容。应使用服务端渲染(SSR)或静态生成,把核心事实直接写入原始 HTML。
- 不要等用户与页面交互后,再通过脚本动态注入 JSON-LD。应让它直接存在于首次响应的 HTML 中,确保爬虫第一次访问就能读取。
上线前先验证,不要凭感觉判断
与其上线后猜测“为什么没有被引用”,不如在发布前完整验证一轮。先使用 Google Rich Results Test(富媒体搜索结果测试)或 Schema.org 官方验证工具,确认 JSON-LD 没有语法错误,必填字段也已完整填写。然后使用浏览器的“查看网页源代码”,而不是开发者工具中的 Elements 面板,确认标记确实存在于原始 HTML 中,并非由脚本后续添加。最后一步最直接:打开 ChatGPT,询问“某个产品是做什么的?”,查看它引用了哪些信源、表述是否准确。这是最贴近真实使用场景的验收测试,往往只需问一次,就能暴露正文与标记之间的不一致。
结构化数据和实体标记只是起点。做好了,ChatGPT 引用你时,事实才会准确;不做,连被清晰引用的基础条件都不具备。多数 B2B 网站的差距,其实不在于有没有写 Schema,而在于标记与正文不一致、实体命名不统一,或爬虫干脆被屏蔽。如果你想了解自己的网站在 ChatGPT 眼中是什么样、差距在哪里,可以预约一次 30 分钟的 GEO 诊断。我们会直接指出网站在信息可提取性和实体清晰度方面的问题。



