你的网站可能有几十篇优质内容,AI 引擎却只能读到其中一部分。没有任何内部链接指向的孤立页面,以及点击层级过深的页面,最容易被 GPTBot、ClaudeBot 和 PerplexityBot 等爬虫跳过。与 Googlebot 相比,它们的抓取预算更紧、回访频率更低、抓取层级也更浅。内容再好,如果爬虫无法触达,也就没有被引用的机会。
什么是孤立页面和点击深度?
孤立页面,是指网站内部没有任何链接可以到达的页面。它可能存在于站点地图、数据库或服务器中,直接输入 URL 也能打开,但从首页出发,无论怎么点击都找不到入口。爬虫主要沿链接发现页面;没有路径,自然也就缺少访问它的理由。
点击深度与此相关,但并不是一回事。它指从首页到某个页面至少需要点击多少次:首页为第 0 层,与首页直接相连的页面为第 1 层,依此类推。当页面的点击深度超过 3 至 4 层,抓取频率往往会明显下降,因为爬虫会优先把有限资源分配给层级较浅、入站链接较多的页面。
为什么 AI 爬虫对这两类问题更“无情”?
传统 SEO 同样关注孤立页面,但 Googlebot 拥有庞大的基础设施,愿意深入抓取网站,也会借助外部链接、浏览器数据等多种信号补充页面发现路径。当前大多数 AI 爬虫并不是这样运作的。
- 抓取预算更保守:多数 LLM 爬虫每次访问只抓取有限数量的页面,深层页面往往排不进抓取队列。
- 回访间隔更长:Googlebot 可能每天都会回来,而 AI 爬虫对同一网站的回访周期通常以周甚至月计算。错过一次,下一次可能要等很久。
- 对外部信号依赖较少:它们主要沿网站内部链接结构发现内容。没有内链路径时,几乎没有备用的发现机制。
- 渲染能力有限:很多 AI 爬虫不会执行 JavaScript,因此看不到由 JS 动态生成的菜单或链接,相关页面实际上也就成了孤立页面。
三步完成内链审计
第一步,对网站进行完整抓取。使用 Screaming Frog、Sitebulb 或其他能够生成链接关系图的爬虫工具,从首页开始模拟爬虫行为,统计每个页面的入站内链数量和点击深度。重点查看两项:入站内链为 0 的页面是潜在孤立页面;点击深度大于 3 的页面则属于抓取风险区。
第二步,将抓取结果与站点地图进行比对。导出 sitemap.xml 中的全部 URL,再导出爬虫实际沿链接发现的 URL,用两份列表做差集。只出现在站点地图、却不在抓取结果中的页面,几乎可以确定是孤立页面。这一步能发现许多仅查看网站后台时难以察觉的遗漏。

第三步,查看服务器日志。筛选 GPTBot、ClaudeBot、PerplexityBot、Google-Extended 等用户代理发出的请求,对比它们实际抓取过哪些 URL。你通常会发现,AI 爬虫的足迹主要集中在浅层页面,而深层页面和孤立页面的抓取记录往往一片空白。日志不会说谎,它会直接告诉你:哪些内容从未进入 AI 的视野。
发现问题后,应该怎么修复?
修复的重点不是给每个页面塞满链接,而是重建合理的内容发现路径,让重要页面离首页更近,并获得更多相关页面的引用。
- 建立主题中心页(支柱页):用一个页面概览某个主题,再向下连接所有子主题页面,把分散的孤立内容归入同一内容集群。
- 增加有上下文的正文链接:在现有文章中自然链接到相关的深度页面。这类带有语义上下文的链接,对 AI 判断主题相关性尤其有价值。
- 扁平化网站结构:把重要页面的点击深度控制在 3 层以内,必要时调整目录结构或导航菜单。
- 检查导航是否由 JavaScript 生成:改用常规 HTML 链接,确保不执行 JS 的爬虫也能读取。
- 删除或合并确实无用的页面:并非每个孤立页面都值得挽救。合并没有价值的页面,把链接权重留给真正需要保留的内容。
修复顺序很重要。优先处理那些希望被 AI 引用、目前却处于孤立或深层位置的页面,例如产品对比、价格说明和深度指南。用户往往会向 AI 助手询问这些内容,它们也是企业最希望被引用的信息。
我们为客户做审计时,最常见的情况是:质量最高的深度内容只被放在很深的目录中,因此从未被任何 AI 爬虫抓取。将这些内容纳入主题中心后,通常会在 1 至 2 个月内开始出现在 AI 的回答中。— Tenten GEO Audit Observation
把内部链接当作检索基础设施
孤立页面和点击深度不是什么玄学,而是可以测量、也可以修复的工程问题。完整抓取网站、比对站点地图、查看服务器日志,你就能知道有多少内容从未进入 AI 的视野。如果想快速了解网站上哪些页面被 AI 漏掉、缺口究竟有多大,可以预约一次 30 分钟的 GEO 诊断。我们会基于实际抓取结果和日志数据,向你展示哪些内容正在被遗漏。



