先说最关键的结论:目前主流 AI 爬虫几乎都不会执行 JavaScript。如果页面内容必须等浏览器端的 JS 运行后才出现,那么在 GPTBot、ClaudeBot 和 PerplexityBot 眼中,这可能就是一张空白页。这不是排名高低的问题,而是内容能否被看见、能否进入引用范围的问题。
很多人会用 Googlebot 的抓取方式推断 AI 爬虫,误区正是从这里开始。经过多年发展,Googlebot 已具备相当成熟的 JavaScript 渲染能力。即使网站采用纯客户端渲染,它通常仍能抓到内容,只是速度更慢、资源消耗更高。但 AI 爬虫的工作方式不同。大多数 AI 爬虫只会获取服务器返回的原始 HTML,读取后便离开;它们不会启动浏览器、等待 JS 执行,也不会进行第二轮渲染。
AI 爬虫和 Googlebot 不是一回事
Googlebot 分两轮处理网页。第一轮先读取原始 HTML,直接提取其中已有的内容;第二轮再将页面放入渲染队列,通过类似 Chrome 的无头浏览器运行 JavaScript,补全动态生成的内容。这套机制需要消耗大量计算资源,而搜索是 Google 的核心业务,因此它愿意承担这笔成本。
AI 公司的爬虫通常没有这第二轮。截至本文发布时,OpenAI 的 GPTBot、Anthropic 的 ClaudeBot、Perplexity 的爬虫,以及负责 ChatGPT 实时搜索的 OAI-SearchBot,均只处理服务器返回的 HTML。原因很现实:让无头浏览器渲染整个互联网,成本高得惊人;它们需要的是“可以直接读入模型的文本”,而不是还原网页的视觉效果。你为前端交互、动画和懒加载编写的 JavaScript,对它们而言可能只是噪声,甚至什么都没有。唯一的例外是 Google AI Overviews,它建立在 Google 现有索引之上,因此可以沿用 Googlebot 的渲染能力。但只要你的目标还包括 ChatGPT、Perplexity 和 Claude,就不能押注爬虫会替你运行 JavaScript。
三种渲染方式,对 AI 可读性有何影响?
同一份内容采用不同的渲染策略,AI 爬虫拿到的结果可能天差地别。核心区别只有一个:内容是“由服务端写入 HTML”,还是“等浏览器端的 JS 执行完毕后才出现”。
- SSG(静态生成):在构建时生成每个页面的完整 HTML,并保存为静态文件。服务器直接返回成品,AI 爬虫可以抓取全文。可读性最好,加载速度也最快。
- SSR(服务端渲染):每次收到请求时,由服务器实时组装完整 HTML,再将结果返回。AI 爬虫同样可以获取全文,但服务器每次都要执行计算,流量较大时需要关注负载。
- CSR(纯客户端渲染):服务器只返回近乎空白的 HTML 骨架,浏览器下载并执行 JS 后才填入真正的内容。如果 AI 爬虫不运行 JS,它看到的就只有空壳,几乎没有可提取、可引用的文本。
直白地说,对 AI 爬虫而言,SSG 和 SSR 没有本质区别:两者都会在服务端把内容写入 HTML,区别只在于“何时计算”。SSG 提前生成,SSR 收到请求后即时生成。真正的分水岭是 CSR。单页应用(SPA)如果没有采用服务端渲染,初始 HTML 往往只有一个空的根容器 div 和一串 script 标签。AI 爬虫读到的正是这些,其中没有正文。

30 秒完成自检
不需要借助工具,也不用先找工程师,你就能判断网站是否对 AI 爬虫可读。在浏览器中打开重要页面,右键选择“查看网页源代码”。注意,不要看开发者工具中的 Elements(元素)面板;那里展示的是 JS 执行后的结果,容易让你误判。“查看网页源代码”呈现的才是服务器最初返回、AI 爬虫实际读取的原始 HTML。
CSR 网站如何修复
确认网站采用 CSR 后,不必立刻推倒重做整个前端。按照投入成本从低到高,通常有三条路径可选。
- 预渲染:当爬虫访问时,返回预先生成的静态 HTML 快照。对于现有 SPA,这是改动较小、见效较快的修复方式;缺点是需要额外维护快照更新。
- 切换到支持 SSR/SSG 的框架:Next.js、Nuxt 和 SvelteKit 等框架可以在服务端渲染首屏内容,同时保留前端交互。对大多数 B2B 客户,我们通常将其作为更稳妥的默认方案。
- 优先为关键页面启用 SSR:资源有限时,不必一次改完整个网站。先把最需要被 AI 引用的页面改为服务端渲染,例如产品页、方案页、定价页和深度文章;其余管理后台和交互工具继续采用 CSR,并不会造成影响。
并非每个页面都值得采用 SSR
渲染策略是一种取舍,不是一种信仰。用户登录后的数据看板、内部工具和高度交互的配置页面,本就不是为了让 AI 引用,继续使用 CSR 完全合理;强行改为 SSR,反而会增加服务器负载。真正需要关注的,是那些你希望“成为 AI 答案来源”的页面:它们要说明你解决什么问题、为什么这样解决,以及与其他方案有何不同。判断标准很简单:如果你希望某个页面的内容出现在 ChatGPT 或 Perplexity 的答案中,就必须让完整内容存在于服务端返回的 HTML 里。
Googlebot 会等待 JavaScript 执行,AI 爬虫不会。在由 AI 决定引用谁的环境中,看不见就等于不存在。— Tenten GEO
很多台湾 B2B 网站面临的可抓取性问题,并不是内容写得不好,而是内容根本没有送到 AI 面前。这类问题往往藏在框架选型和渲染设置中:网站用肉眼看一切正常,打开“查看网页源代码”后才会暴露。如果你不确定重要页面能否被 AI 读取,我们的 30 分钟 GEO 诊断会直接使用你的 URL,检查首屏内容是否存在于 HTML 中,并找出应优先改为服务端渲染的页面。



