GEO
返回博客
技术 AEO 实施落地

孤立页面与点击深度:通过内链审计找出 AI 爬虫无法触达的内容

孤立页面和点击层级过深的页面,最容易被 AI 爬虫漏掉。本文提供一套三步内链审计方法,帮助你找出 GPTBot、ClaudeBot 等爬虫无法抓取的页面,并重构更利于 AI 检索与引用的网站结构。

Tenten GEO 团队发布于 2024-08-065 分钟阅读
深暖炭黑色背景上,一条光路穿过节点网络,几处孤立节点隐没在阴影中,象征 AI 爬虫跳过孤立页面。

你的网站可能有几十篇优质内容,AI 引擎却只能读到其中一部分。没有任何内部链接指向的孤立页面,以及点击层级过深的页面,最容易被 GPTBot、ClaudeBot 和 PerplexityBot 等爬虫跳过。与 Googlebot 相比,它们的抓取预算更紧、回访频率更低、抓取层级也更浅。内容再好,如果爬虫无法触达,也就没有被引用的机会。

什么是孤立页面和点击深度?

孤立页面,是指网站内部没有任何链接可以到达的页面。它可能存在于站点地图、数据库或服务器中,直接输入 URL 也能打开,但从首页出发,无论怎么点击都找不到入口。爬虫主要沿链接发现页面;没有路径,自然也就缺少访问它的理由。

点击深度与此相关,但并不是一回事。它指从首页到某个页面至少需要点击多少次:首页为第 0 层,与首页直接相连的页面为第 1 层,依此类推。当页面的点击深度超过 3 至 4 层,抓取频率往往会明显下降,因为爬虫会优先把有限资源分配给层级较浅、入站链接较多的页面。

为什么 AI 爬虫对这两类问题更“无情”?

传统 SEO 同样关注孤立页面,但 Googlebot 拥有庞大的基础设施,愿意深入抓取网站,也会借助外部链接、浏览器数据等多种信号补充页面发现路径。当前大多数 AI 爬虫并不是这样运作的。

  • 抓取预算更保守:多数 LLM 爬虫每次访问只抓取有限数量的页面,深层页面往往排不进抓取队列。
  • 回访间隔更长:Googlebot 可能每天都会回来,而 AI 爬虫对同一网站的回访周期通常以周甚至月计算。错过一次,下一次可能要等很久。
  • 对外部信号依赖较少:它们主要沿网站内部链接结构发现内容。没有内链路径时,几乎没有备用的发现机制。
  • 渲染能力有限:很多 AI 爬虫不会执行 JavaScript,因此看不到由 JS 动态生成的菜单或链接,相关页面实际上也就成了孤立页面。

三步完成内链审计

第一步,对网站进行完整抓取。使用 Screaming Frog、Sitebulb 或其他能够生成链接关系图的爬虫工具,从首页开始模拟爬虫行为,统计每个页面的入站内链数量和点击深度。重点查看两项:入站内链为 0 的页面是潜在孤立页面;点击深度大于 3 的页面则属于抓取风险区。

第二步,将抓取结果与站点地图进行比对。导出 sitemap.xml 中的全部 URL,再导出爬虫实际沿链接发现的 URL,用两份列表做差集。只出现在站点地图、却不在抓取结果中的页面,几乎可以确定是孤立页面。这一步能发现许多仅查看网站后台时难以察觉的遗漏。

以首页为中心的链接关系图,突出显示孤立页面和点击深度过大的页面。
内链审计的核心:找出没有入站内链或隐藏层级过深的页面。

第三步,查看服务器日志。筛选 GPTBot、ClaudeBot、PerplexityBot、Google-Extended 等用户代理发出的请求,对比它们实际抓取过哪些 URL。你通常会发现,AI 爬虫的足迹主要集中在浅层页面,而深层页面和孤立页面的抓取记录往往一片空白。日志不会说谎,它会直接告诉你:哪些内容从未进入 AI 的视野。

发现问题后,应该怎么修复?

修复的重点不是给每个页面塞满链接,而是重建合理的内容发现路径,让重要页面离首页更近,并获得更多相关页面的引用。

  • 建立主题中心页(支柱页):用一个页面概览某个主题,再向下连接所有子主题页面,把分散的孤立内容归入同一内容集群。
  • 增加有上下文的正文链接:在现有文章中自然链接到相关的深度页面。这类带有语义上下文的链接,对 AI 判断主题相关性尤其有价值。
  • 扁平化网站结构:把重要页面的点击深度控制在 3 层以内,必要时调整目录结构或导航菜单。
  • 检查导航是否由 JavaScript 生成:改用常规 HTML 链接,确保不执行 JS 的爬虫也能读取。
  • 删除或合并确实无用的页面:并非每个孤立页面都值得挽救。合并没有价值的页面,把链接权重留给真正需要保留的内容。

修复顺序很重要。优先处理那些希望被 AI 引用、目前却处于孤立或深层位置的页面,例如产品对比、价格说明和深度指南。用户往往会向 AI 助手询问这些内容,它们也是企业最希望被引用的信息。

我们为客户做审计时,最常见的情况是:质量最高的深度内容只被放在很深的目录中,因此从未被任何 AI 爬虫抓取。将这些内容纳入主题中心后,通常会在 1 至 2 个月内开始出现在 AI 的回答中。Tenten GEO Audit Observation

把内部链接当作检索基础设施

孤立页面和点击深度不是什么玄学,而是可以测量、也可以修复的工程问题。完整抓取网站、比对站点地图、查看服务器日志,你就能知道有多少内容从未进入 AI 的视野。如果想快速了解网站上哪些页面被 AI 漏掉、缺口究竟有多大,可以预约一次 30 分钟的 GEO 诊断。我们会基于实际抓取结果和日志数据,向你展示哪些内容正在被遗漏。

常见问题

孤立页面会影响 AI 引擎引用我的内容吗?
会。AI 爬虫主要沿内部链接发现页面。没有任何链接指向的孤立页面往往始终不会被抓取;无论内容质量多高,自然也不会出现在 ChatGPT 或 Perplexity 的回答中。
把页面加入站点地图,就能解决孤立页面问题吗?
不能。站点地图只能告诉引擎页面存在,无法传递内部链接所代表的重要性信号。AI 引擎在判断是否抓取和引用时,仍高度依赖内链的结构与上下文,因此还需要为页面建立真正可达的链接路径。
点击深度达到多少就算过深?
通常建议把重要页面控制在距首页 3 次点击以内。页面超过 3 至 4 层后,AI 爬虫的抓取频率会明显下降,在抓取预算有限时也更容易被跳过,其中深度内容受到的影响尤其明显。

准备好了吗

你的品牌在 AI 答案中有多高的可见度?

通过 30 分钟 GEO 诊断,了解品牌在主要 AI 引擎中的可见度缺口,以及应该优先解决的问题。

预约 30 分钟诊断