← 术语表

定义

抓取预算

Crawl Budget

抓取预算是 Googlebot 每天会来你站抓多少页。小站从来不用想它;大站会因为它丢排名。什么时候它真的重要、怎么从日志里查,这篇讲清楚。

抓取预算是搜索引擎每天花在你站上的抓取配额。两个旋钮决定它:抓取容量(你的基础设施受得了多少)和抓取需求(引擎多想要你的内容)。新站和低权威站配额小;热门、高频更新的站配额大。

什么时候它真的重要

规则:抓取预算问题是 URL 空间问题。症状:

  • 分面筛选生成百万级组合(?color=red&size=m&sort=price...
  • 日历页带无限的下个月链接
  • 预发环境或重复路径留在可抓取状态
  • 软 404 和过期页返回 200

每抓一个垃圾 URL,就是一个好 URL 没被抓——在大站上,这就是赚钱页面的收录损失。

什么时候它不重要

独立 URL 一万以内、架构干净、没有意外的 URL 爆炸:Google 想抓的都抓了,「预算」从来不是约束。一个 300 篇的博客花一个冲刺优化抓取预算,是从内容和外链上偷时间。

怎么诚实地测量

服务器日志是唯一真相源。过滤已验证的 Googlebot 命中(反查 DNS,伪装 user-agent 很常见),按天计数,再按 URL 模式分组。交付物是一张表的答案:哪些 URL 家族消耗了多少抓取份额,这个份额配不配得上它们的价值。

相关概念

常见问题

SEO 里的抓取预算是什么?

抓取预算是搜索引擎爬虫每段时间会请求你站的 URL 数量。由两个因素决定:抓取容量(你服务器能承受多少)和抓取需求(引擎多想要你的内容)。浪费在垃圾 URL 上,赚钱的页面就被饿着。

小站需要关心抓取预算吗?

基本不需要。独立 URL 在一万以内、内链结构正常的情况下,Google 想抓就抓,预算不构成约束。真正出问题的是分面导航、参数 URL、无限内链,以及不小心把 URL 空间撑爆的站。

怎么查抓取预算?

从服务器日志查,不是从工具查:过滤 Googlebot、按天计数、反查 DNS 验证(假 Googlebot 很常见),再按 URL 模式分解消耗。我们的审计工具能对日志提取的 URL 分类,看花费在值钱页还是垃圾页上。

相关词条