GEO
返回博客
技术 AEO 实施落地

AI 抓取能力快速体检:5 分钟检查 robots、渲染与 schema

如果 AI 搜索看不到你,问题往往不在内容本身,而是爬虫无法读取页面。这套 5 分钟体检将带你检查 robots.txt 是否屏蔽 GPTBot、页面内容是否依赖 JavaScript 才能显示,以及 schema 结构化数据是否正确,帮助你快速找出 AI 抓取能力的缺口,并明确修复顺序。

Tenten GEO 团队发布于 2024-11-294 分钟阅读
扫描光束穿过半开的闸门,象征 AI 爬虫能否读取网站页面。

如果你在 AI 搜索中找不到自己,原因很可能不是内容不够好,而是爬虫根本读不到页面。robots.txt 屏蔽了 GPTBot、正文藏在依赖 JavaScript 才能显示的区块中,或者整个页面没有任何结构化数据——只要其中一个问题存在,文章写得再用心,对 AI 引擎来说也可能等同于不存在。这类问题不必等到完整的 30 天审计才能发现。用 5 分钟完成 3 个步骤,你就能先自行排查。

先说清楚:AI 爬虫并不等同于 Googlebot

不同 AI 引擎会派出各自的爬虫采集数据,每个爬虫都有独立的 user-agent,行为方式也不同于 Googlebot。最关键的区别在于:为了参与排名,Googlebot 愿意投入资源执行页面上的 JavaScript;而出于速度和成本考虑,大多数 AI 爬虫主要抓取原始 HTML,很少执行、甚至完全不执行 JavaScript。因此,“Google 收录正常”从来不等于“ChatGPT、Perplexity 和 Claude 能读到你的内容”。体检时应单独站在 AI 爬虫的视角检查,而不是照搬传统 SEO 清单。

第 1 分钟:打开 robots.txt,确认 AI 爬虫是否被屏蔽

在域名末尾加上 /robots.txt 并直接打开。使用 Ctrl+F 搜索以下名称,查看它们是否被 Disallow 屏蔽,或者根本没有被单独提及(通常未提及就代表允许抓取)。很多网站并非有意屏蔽 AI 爬虫,而是安全服务商、CDN 或某个插件的默认规则拦截了 Googlebot 以外的所有爬虫,AI 引擎也因此被挡在门外。

  • GPTBot:OpenAI 用于抓取训练与检索数据的爬虫。如果屏蔽它,ChatGPT 将无法获取你的内容。
  • OAI-SearchBot 和 ChatGPT-User:分别对应 ChatGPT 搜索,以及用户提问时的即时页面访问。
  • ClaudeBot:Anthropic 的 Claude 用于采集和检索网页的爬虫。
  • PerplexityBot 和 Perplexity-User:Perplexity 分别在建立索引和即时读取页面时使用。
  • Google-Extended:控制内容能否用于 Gemini。屏蔽它不会影响常规 Google 排名,但会让你的内容从 Gemini 的回答中消失。

第 2~3 分钟:关闭 JavaScript,看看内容是否还在

这一步只验证一件事:你的文字是否真正写在 HTML 中,还是必须等浏览器运行 JavaScript 后才会出现。最快的方法是在 Chrome DevTools 中禁用 JavaScript,然后刷新页面;更直接的做法是在 URL 前加上 view-source: 查看源代码,再用 Ctrl+F 搜索文章中的完整句子。如果找不到标题、正文或价格,就说明这些内容由前端渲染,只读取 HTML 的 AI 爬虫拿到的会是一个空壳。你可以把自己代入纯文本浏览场景:爬虫能看到什么,AI 才有内容可以引用。

5 分钟 AI 抓取能力体检的三个检查层面:robots.txt、页面渲染与 schema。
体检只看三件事:爬虫能否进入、内容能否被抓取、结构化数据是否正确。

第 4~5 分钟:检查 schema 是否存在、内容是否正确

继续使用 view-source,这次搜索 application/ld+json,确认页面是否嵌入了结构化数据,以及标记类型是否正确。文章页应使用 Article,公司页应使用 Organization,问答页应使用 FAQPage,产品页应使用 Product。Schema 不会直接提升排名,它的作用是帮助 AI 以最低成本确认三件事:这个页面讲什么、由谁撰写、信息是否可信。这里有一个常见误区:错误的 schema 比完全没有 schema 更糟。如果页面声称使用了 FAQPage,却找不到对应的问答内容;或者标记中的作者、日期与页面内容不一致,AI 会判断该页面信息不可靠,并降低引用意愿。

一页检查清单:5 分钟内应该看到什么

  1. robots.txt:上述 AI 爬虫均未被 Disallow 屏蔽,也不存在 User-agent: * 搭配 Disallow: / 的全站封锁规则。
  2. 渲染:关闭 JavaScript 后,标题、正文和关键数据(如价格、规格)仍可在原始 HTML 中读取。
  3. Schema:页面包含与内容类型对应的 JSON-LD,标记内容与屏幕上显示的信息一致,没有虚假或过期信息。
  4. 三项全部通过:AI 抓取能力的基础没有问题,下一步可以优化内容及引用结构。
  5. 任何一项未通过:先别急着继续生产内容。这一项就是当前最需要补上的缺口。
AI 抓取能力是获得引用资格的门槛,不是额外加分项。跨不过这道门槛,内容再好,AI 也无法读取或引用。Tenten GEO Consulting Team

发现问题后,应该先修哪一项?

修复顺序很明确。首先解除 robots.txt 的屏蔽——通常只需修改一行规则即可放行,影响最大,而且往往当天就能生效。其次处理渲染问题,因为这类问题大多需要工程团队介入,将关键内容改为服务端渲染,或至少让原始 HTML 直接包含正文。虽然成本更高,但它直接决定 AI 能否读到你的内容。最后再补齐 schema,因为这一步是把基础从及格补到满分,而不是解决从 0 到 1 的问题。按照这个顺序,就能用最少的投入优先补上最致命的缺口。

这套 5 分钟体检可以发现大多数明显漏洞,但无法识别更深层的问题,例如服务器向 AI 爬虫与普通用户返回了不同内容、可引用段落的结构过于松散,或者跨页面的实体信息与可信度信号不一致。如果你想进一步了解这些层面的缺口,可以预约一次 30 分钟的 GEO 诊断。我们会从 Tenten 的 GEO 审计视角出发,把你的抓取能力缺口整理成一份可以立即着手执行的清单。

常见问题

AI 爬虫和 Googlebot 是一回事吗?屏蔽其中一个会怎样?
不是。GPTBot、ClaudeBot、PerplexityBot 和 Google-Extended 彼此独立,需要在 robots.txt 中分别放行。Google 正常收录,并不代表 ChatGPT 或 Perplexity 能读取你的页面,两者应分开检查。
为什么通过 JavaScript 显示内容会影响 AI 抓取?
大多数 AI 爬虫不会执行 JavaScript,或无法完整执行,只会读取原始 HTML。如果正文、标题和价格依赖前端渲染,爬虫拿到的就只是一个空壳,自然没有可供引用的内容。
没有 schema,AI 就完全抓不到我的内容吗?
并非完全抓不到,但 schema 能帮助 AI 快速确认页面主题、作者与可信度,从而提高内容被引用的机会。需要注意的是,错误或虚假的 schema 比完全没有更有害。比如声称页面包含 FAQ,却没有对应内容,就可能被判断为不可信。

准备好了吗

你的品牌在 AI 答案中有多高的可见度?

通过 30 分钟 GEO 诊断,了解品牌在主要 AI 引擎中的可见度缺口,以及应该优先解决的问题。

预约 30 分钟诊断