如果你在 AI 搜索中找不到自己,原因很可能不是内容不够好,而是爬虫根本读不到页面。robots.txt 屏蔽了 GPTBot、正文藏在依赖 JavaScript 才能显示的区块中,或者整个页面没有任何结构化数据——只要其中一个问题存在,文章写得再用心,对 AI 引擎来说也可能等同于不存在。这类问题不必等到完整的 30 天审计才能发现。用 5 分钟完成 3 个步骤,你就能先自行排查。
先说清楚:AI 爬虫并不等同于 Googlebot
不同 AI 引擎会派出各自的爬虫采集数据,每个爬虫都有独立的 user-agent,行为方式也不同于 Googlebot。最关键的区别在于:为了参与排名,Googlebot 愿意投入资源执行页面上的 JavaScript;而出于速度和成本考虑,大多数 AI 爬虫主要抓取原始 HTML,很少执行、甚至完全不执行 JavaScript。因此,“Google 收录正常”从来不等于“ChatGPT、Perplexity 和 Claude 能读到你的内容”。体检时应单独站在 AI 爬虫的视角检查,而不是照搬传统 SEO 清单。
第 1 分钟:打开 robots.txt,确认 AI 爬虫是否被屏蔽
在域名末尾加上 /robots.txt 并直接打开。使用 Ctrl+F 搜索以下名称,查看它们是否被 Disallow 屏蔽,或者根本没有被单独提及(通常未提及就代表允许抓取)。很多网站并非有意屏蔽 AI 爬虫,而是安全服务商、CDN 或某个插件的默认规则拦截了 Googlebot 以外的所有爬虫,AI 引擎也因此被挡在门外。
- GPTBot:OpenAI 用于抓取训练与检索数据的爬虫。如果屏蔽它,ChatGPT 将无法获取你的内容。
- OAI-SearchBot 和 ChatGPT-User:分别对应 ChatGPT 搜索,以及用户提问时的即时页面访问。
- ClaudeBot:Anthropic 的 Claude 用于采集和检索网页的爬虫。
- PerplexityBot 和 Perplexity-User:Perplexity 分别在建立索引和即时读取页面时使用。
- Google-Extended:控制内容能否用于 Gemini。屏蔽它不会影响常规 Google 排名,但会让你的内容从 Gemini 的回答中消失。
第 2~3 分钟:关闭 JavaScript,看看内容是否还在
这一步只验证一件事:你的文字是否真正写在 HTML 中,还是必须等浏览器运行 JavaScript 后才会出现。最快的方法是在 Chrome DevTools 中禁用 JavaScript,然后刷新页面;更直接的做法是在 URL 前加上 view-source: 查看源代码,再用 Ctrl+F 搜索文章中的完整句子。如果找不到标题、正文或价格,就说明这些内容由前端渲染,只读取 HTML 的 AI 爬虫拿到的会是一个空壳。你可以把自己代入纯文本浏览场景:爬虫能看到什么,AI 才有内容可以引用。

第 4~5 分钟:检查 schema 是否存在、内容是否正确
继续使用 view-source,这次搜索 application/ld+json,确认页面是否嵌入了结构化数据,以及标记类型是否正确。文章页应使用 Article,公司页应使用 Organization,问答页应使用 FAQPage,产品页应使用 Product。Schema 不会直接提升排名,它的作用是帮助 AI 以最低成本确认三件事:这个页面讲什么、由谁撰写、信息是否可信。这里有一个常见误区:错误的 schema 比完全没有 schema 更糟。如果页面声称使用了 FAQPage,却找不到对应的问答内容;或者标记中的作者、日期与页面内容不一致,AI 会判断该页面信息不可靠,并降低引用意愿。
一页检查清单:5 分钟内应该看到什么
- robots.txt:上述 AI 爬虫均未被 Disallow 屏蔽,也不存在 User-agent: * 搭配 Disallow: / 的全站封锁规则。
- 渲染:关闭 JavaScript 后,标题、正文和关键数据(如价格、规格)仍可在原始 HTML 中读取。
- Schema:页面包含与内容类型对应的 JSON-LD,标记内容与屏幕上显示的信息一致,没有虚假或过期信息。
- 三项全部通过:AI 抓取能力的基础没有问题,下一步可以优化内容及引用结构。
- 任何一项未通过:先别急着继续生产内容。这一项就是当前最需要补上的缺口。
AI 抓取能力是获得引用资格的门槛,不是额外加分项。跨不过这道门槛,内容再好,AI 也无法读取或引用。— Tenten GEO Consulting Team
发现问题后,应该先修哪一项?
修复顺序很明确。首先解除 robots.txt 的屏蔽——通常只需修改一行规则即可放行,影响最大,而且往往当天就能生效。其次处理渲染问题,因为这类问题大多需要工程团队介入,将关键内容改为服务端渲染,或至少让原始 HTML 直接包含正文。虽然成本更高,但它直接决定 AI 能否读到你的内容。最后再补齐 schema,因为这一步是把基础从及格补到满分,而不是解决从 0 到 1 的问题。按照这个顺序,就能用最少的投入优先补上最致命的缺口。
这套 5 分钟体检可以发现大多数明显漏洞,但无法识别更深层的问题,例如服务器向 AI 爬虫与普通用户返回了不同内容、可引用段落的结构过于松散,或者跨页面的实体信息与可信度信号不一致。如果你想进一步了解这些层面的缺口,可以预约一次 30 分钟的 GEO 诊断。我们会从 Tenten 的 GEO 审计视角出发,把你的抓取能力缺口整理成一份可以立即着手执行的清单。



