如果只记住一个结论,那就是:想让 AI 引擎准确读取并引用页面,就用 JSON-LD。将同一套 schema.org 标记改用 Microdata 或 RDFa,并不会导致 Google 拒绝解析,但 AI 爬虫需要额外把散落在 HTML 各处的属性重新拼成完整实体。每多一道处理环节,就多一次遗漏或误读的可能。
三种格式描述的其实是同一套词汇
先澄清一个常见误区:JSON-LD、Microdata 和 RDFa 并不是三套相互竞争的材料,而是将 schema.org 词汇写入网页的三种语法。它们标注的实体并无不同,Organization、Product、Article、FAQPage 和 HowTo 都来自同一套词汇。区别只在于这些属性放在哪里、以什么形式承载。Schema.org 官方支持全部三种格式,Google 也都能解析。因此,本文比较的重点不是“哪一种能用”,而是“哪一种最便于机器读取”。
根本区别:结构化数据如何与 HTML 耦合
三者最关键的差异,在于结构化数据与 HTML 绑定得有多紧。Microdata 直接把标记写进 HTML 元素,依靠 itemscope、itemtype 和 itemprop 等属性,逐层附着在 div、span、h1 上。RDFa 的思路相近,只是改用 vocab、typeof、property 等一组属性,在现有标签中叠加语义;表达能力更完整,语法也更繁复。JSON-LD 则完全相反:它把整个实体写成一段独立的 JSON,放入 type 为 application/ld+json 的 script 标签中,与页面上展示的 HTML 分离。
- JSON-LD:完整、自包含的 JSON 对象,集中放在 script 标签中;与页面布局解耦,最便于维护和程序化处理,也是 Google 明确优先推荐的格式。
- Microdata:使用 itemscope、itemprop 等属性嵌入可见的 HTML;标记与内容紧密绑定,调整布局时很容易破坏原有标记。
- RDFa:通过 vocab、typeof、property 等属性嵌入页面,语义表达能力最强,也最接近 W3C 的关联数据理念;但语法负担最重,也最容易出错。
为什么 AI 爬虫更偏好 JSON-LD
AI 爬虫解析 JSON-LD 更省力,原因很直接:一个实体就是一个完整的 JSON 对象,字段、值和嵌套关系都集中在同一个区块中。解析器读入后即可得到清晰的对象树,无须回头遍历整个 DOM。Microdata 和 RDFa 则要求机器先扫描全部 HTML,逐一收集分散在不同标签上的属性,再根据嵌套关系将它们重组为实体。页面越复杂、布局层级越深,重组时出错的概率就越高。
还有两个实际因素会进一步放大差距。第一是 JavaScript 渲染:许多 AI 爬虫执行 JS 时比 Googlebot 更保守。如果 Microdata 由前端框架动态插入 DOM,抓取发生时它可能尚未生成。JSON-LD 的常见做法是在服务端输出完整字符串,页面一经抓取即可使用。第二是维护成本:JSON-LD 集中在一处,如果要新增 FAQPage 或修改产品价格,只需调整一段 JSON,不会影响页面布局;而对于内联标记,每次改版都要重新确认相关属性是否被移动或删除。

Microdata 和 RDFa 还有使用价值吗?
这并不意味着 Microdata 和 RDFa 是错误的选择。如果网站使用较老的 CMS 或电商主题,其内置结构化标记很可能就是 Microdata;只要运行正常,就没必要专门更换。对于需要跨词汇体系表达复杂关联数据的场景,例如开放政府数据或学术出版,RDFa 依然有价值。但如果具体目标是“被 AI 引擎引用”,两者的优势几乎派不上用场,短板反而会被放大。
迁移到 JSON-LD 前,先避开这些问题
- 标记与页面可见内容不一致:JSON-LD 中的评分、价格和作者必须与用户实际看到的内容相符,否则可能被判定为垃圾标记。
- 有脚本,却缺少必填字段:例如 Product 缺少 name 或 offers,FAQPage 中的问题没有对应答案,机器可能直接跳过整个实体。
- 忘记用 @id 关联实体:当 Organization、WebSite 和 Article 相互关联时,使用 @id 建立引用,有助于 AI 构建更完整的品牌知识图谱。
- 未经验证就上线:先用 Google 的富媒体搜索结果测试或 schema.org 验证器检查,远比日后再从 Search Console 中排查错误高效。
还有一点很容易被忽略:结构化数据不是用来欺骗机器的,而是帮助机器确认它从页面中读到的内容。因此,最稳妥的做法是让 JSON-LD 成为可见内容的镜像——页面上出现的内容才写进标记,标记中声明的信息也都能在页面上找到。这种一致性,是 AI 引擎判断页面是否可信、是否值得引用的基础。
结构化数据无法让内容空洞的页面变得值得引用;它真正的作用,是避免原本值得引用的页面,仅仅因为机器无法理解而被跳过。— Tenten GEO Technical Audit Team
如何检查你的网站
回到自己的网站,可以先问三个问题:核心页面使用了哪种格式?同一个实体是否被重复标注?JSON-LD 字段是否与页面可见内容一致?大多数 B2B SaaS 网站的结构化数据都经历了不同时期的建设和多轮外包,格式混用、字段缺失十分常见。在 AI 引擎看来,这些缺口都可能成为跳过网站的理由。如果想了解 AI 爬虫眼中的网站是什么样、哪些实体没有被识别,可以预约一次 30 分钟的 GEO 诊断,我们会直接用你的实际页面逐项检查。



