AI 爬虫的抓取能力并非没有上限,而且它们把资源耗在错误页面上的情况,可能比你想象得更普遍。对于中大型网站,GPTBot、ClaudeBot 或 PerplexityBot 每天发起的请求中,可能有一半以上落在永远不会被引用的 URL 上,例如分页、筛选参数和过期活动页。结果是,你真正希望被 AI 引用的产品页和对比文章,反而更新最慢、重新抓取的频率最低。优化抓取预算,就是要把这股流量重新引向正确的出口。
AI 爬虫抓得越多越好吗?
抓取预算(crawl budget)过去主要是 Google SEO 关注的问题,指搜索引擎愿意投入多少资源抓取你的网站。它由两个因素决定:服务器能够承受多高的抓取频率(crawl rate limit),以及引擎认为你的网站有多大抓取价值(crawl demand)。进入 GEO 时代,参与者从一个增加到十余个,各自的抓取需求和访问礼节也不相同。从部分网站的服务器日志来看,ClaudeBot 和 GPTBot 的抓取量已经接近甚至超过传统的 Googlebot。它们大多不执行 JavaScript,对响应速度较为敏感;面对大量低价值 URL 时,也不会自动变得更聪明——你提供什么,它们就抓取什么。
先弄清楚是谁在消耗你的预算
开始优化前,首先要确认是谁在消耗抓取预算。不同 AI 爬虫承担的任务并不相同:有些用于训练模型,有些用于实时检索,也就是只在用户对话中提出问题时抓取内容,还有一些兼顾两种用途。这些差异决定了你是否要允许它们访问,以及开放访问后应优先让它们抓取哪些内容。以下是大多数 B2B 网站日志中最常见的 AI 爬虫。请记住它们的 user agent 名称,后续分析日志和配置 robots.txt 时都会用到。
- GPTBot(用于 OpenAI 训练)、OAI-SearchBot(用于 ChatGPT 实时搜索)
- ClaudeBot/Claude-User(用于 Anthropic 训练和实时检索)
- PerplexityBot/Perplexity-User(用于 Perplexity 索引和即时抓取)
- Google-Extended(控制 Gemini 是否可以使用你的内容,不影响常规搜索排名)
- Amazonbot、Bytespider、Meta-ExternalAgent(抓取量较大,却经常被低估的流量来源)
三个迹象表明你的抓取预算正在流失
- 日志中超过一半的爬虫请求落在带问号参数、排序或筛选条件的 URL 上,而不是核心内容页。
- 重要页面,例如新发布的对比文章、价格页和案例页,已经两三周没有被 AI 爬虫重新抓取。
- 爬虫频繁遇到 404、301 重定向,或响应时间长达三四秒的页面——每次请求都会消耗预算。
网站规模越大,这个问题越明显。一个只有 30 个页面的图片网站,几乎不必担心抓取预算;但只要网站包含电商分类、博客分页、多语言版本,或者会生成大量参数组合的筛选导航,可抓取 URL 的数量就很容易膨胀到实际内容页的数十倍。爬虫预算是有限的,多出来的 URL 不会为你带来更多有效收录,只会稀释重要页面被抓取的机会。

通过服务器日志找到预算漏洞
靠猜没有用,必须查看日志。服务器访问日志是分析抓取预算最可靠的数据来源。筛选出 AI 爬虫的 user agent 后,你可以计算三项数据:各类爬虫抓取了多少次、请求集中在哪些 URL 类型,以及不同状态码(200、301、404、5xx)分别占多大比例。大多数浪费通常集中在少数几种模式上:分面筛选产生的参数组合、站内搜索结果页、无休止的分页,以及早该下线的过期活动页。只有先完成测量,才能知道关闭哪一段“水管”最节省资源。AI 可见度监测能告诉你网站是否获得引用,日志则能显示爬虫把时间花在了哪里;两类数据需要结合起来分析。
用六项措施把预算重新引导至重要页面
- 在 robots.txt 中使用 Disallow,屏蔽站内搜索、筛选参数、购物车等永远不需要抓取的路径,从源头减少无效请求。
- 为重复或高度相似的页面设置 canonical,让爬虫把预算集中在规范版本上,而不是逐一抓取每个排序变体。
- 清理 301 重定向链,以及指向 404 页面的内部死链。爬虫每多跟随一次无效重定向,就会少抓取一个真正有价值的页面。
- 维护干净的 XML 站点地图,只保留可被索引的 URL,并让 lastmod 如实反映更新时间,帮助爬虫判断哪些页面需要重新抓取。
- 通过内部链接把权重和抓取路径引向核心页面。大多数 AI 爬虫不执行 JavaScript,因此菜单和相关文章必须使用真正的 HTML 链接,不能只依赖前端动态生成。
- 缩短首字节时间(TTFB)并减小页面体积。响应越快,爬虫在同等预算内能够抓取的页面就越多。
优先让 AI 爬虫抓取“答案型”页面
节省下来的预算,必须用在正确的页面上。对于 GEO,最值得优先并频繁抓取的,是能够直接回答问题、结构清晰且便于提取内容的页面:定义明确的术语页、包含具体数字的对比文章、分步骤教程,以及带有 FAQ 的产品页。AI 引擎生成答案时,最有可能引用这类来源。你可以在站点地图中优先列出这些页面,通过多个内部链接为其建立抓取路径,并持续更新内容,明确告诉爬虫:这里值得经常访问。相反,感谢页、登录页和无限滚动的标签聚合页则应排除在外。
抓取预算优化的重点,从来不是让爬虫抓得更多,而是让它每次抓取,都尽可能命中你希望被 AI 引用的页面。— Tenten GEO Consulting Team
抓取预算优化并非一劳永逸。网站会产生新的参数,营销团队会推出新的活动页,网站改版也会增加新的重定向链接。预算漏洞会不断出现,因此应把日志分析纳入每季度的固定工作,持续关注爬虫的有效命中率,以及重要页面的重新抓取间隔。如果你不确定 AI 爬虫目前把时间花在了网站的哪些位置,也不知道哪些本应获得引用的页面根本没有被抓取,可以预约一次 30 分钟的 GEO 诊断,我们会根据你的服务器日志找出预算漏洞。



