先说结论,省得你白读:绝大多数网站不需要关心抓取预算。

这不是我们的判断,是 Google 自己在面向大型站点的那份指南开头写的原话——如果你的站没有大量快速变化的页面,或者你的页面基本上发布当天就被抓走了,这份指南你不用读

中文世界里这个概念被传得很热,但它真正的适用范围窄得超出多数人的想象。

先讲边界,再讲原理,是因为顺序反了会浪费你的时间:小站花几周去「优化抓取预算」,通常什么也改变不了,真正卡住的是别的关卡。

一、它是什么

引擎不会无限制地抓你的站。它每天愿意在你这儿花多少次请求,大致由两个因子相乘决定:

抓取速率上限——你扛不扛得住。 引擎会试探性地加大并发,如果你的服务器响应变慢或者开始报错,它就退回去。所以服务器越快越稳,同样的时间窗口里它能抓的页面就越多。

抓取需求——你值不值得抓。 你的内容更新得频不频繁、历史上抓回去的东西有多少真被用上了、这个站在引擎眼里有多重要。一个半年不更新的站,引擎没有理由天天来。

两个因子里,第二个通常才是瓶颈。很多人以为加带宽、上 CDN 就能让爬虫多来,实际上如果引擎压根不觉得你值得频繁抓,速率上限提得再高也用不上。

二、谁真的需要管

Google 给的门槛比多数人想的高得多,而且是有具体数字的:

情况门槛
大型站,内容中等频率更新(比如每周)100 万个以上独立页面
中型及以上,内容变化极快(每天)1 万个以上独立页面
站长平台里「已发现 — 尚未编入索引」占比很高不看规模

前两条几乎把所有企业官网、内容站排除在外了。一个几千页的站去优化抓取预算,通常是在解决一个自己并不存在的问题——真正卡住它的多半在别的关卡。

第三条是唯一不看站点规模的判据,也是最实用的一条:引擎已经知道有这些地址,却迟迟没去抓。它是事实,不是推测。

除此之外还有一种情况值得看一眼:日志里爬虫来得不少,但抓的全是些无关紧要的地址。这不是规模问题,是浪费问题,下一节讲怎么认。

三、额度被浪费是什么样子

去服务器日志里按 User-Agent 分组,统计每个爬虫命中的地址类型分布:正文页占多少、静态资源占多少、参数地址占多少。

健康的样子是正文页占大头。不健康的形态有这么几种:

  • 参数地址吃掉大半。同一个商品列表因为筛选条件不同,被当成几十个不同地址反复抓。
  • 跳转链吃掉额度。每一跳都是一次完整请求。一条 http → https → 带斜杠 → 最终地址 的链,四次请求才拿到一个页面。
  • 死链反复被抓。引擎会隔一段时间回来确认它是不是真的没了,一条 404 能消耗很久的额度。
  • 最极端的一种:某个爬虫反复命中同一个静态脚本文件,正文页一个都没进。它的额度全花在一个死胡同上——脚本文件里没有链接,爬到那儿就走不下去了。这不是假设,各家爬虫在同一个站上的实际表现,实测见爬虫到访观测 2026-08 期

四、怎么省

按性价比排序:

  1. 先修服务器响应时间。 这一条同时改善两个因子,而且不需要动任何页面。
  2. 收拾跳转链。 让内链、站点地图、canonical 全部指向最终地址,别让爬虫走两跳三跳,见canonical 是什么:同一篇内容有多个地址会怎样
  3. 处理参数地址。 能挡的用 robots.txt 挡掉,不能挡的用 canonical 合并回主地址,见robots.txt 怎么读
  4. 清理站点地图。 别把死链和低价值地址放进去,那等于主动把爬虫往那边引。
  5. 别用大量低价值页面撑数量。 这一条最反直觉:页面越多,单个页面分到的注意力越少。

五、落回 GEO:为什么 AI 还在用你的旧口径

抓取预算和 GEO 之间有一条不太明显、但很要紧的联系。

额度被吃光时,最先被牺牲的是最新的内容。 引擎按它自己的优先级排队,新发的、刚改的那些排在后面,而 AI 引用的是它索引里那一版

于是就有了这个常见现象:你已经把官网上的品牌介绍改了,AI 回答时却还在用几个月前那一版的说法。很多时候原因不在 AI,在于那一版根本没被重新抓过。

这也是为什么第二关(抓取)值得单独拿出来看:它不像收录那样有个明确的数字可查,出问题时是悄悄失效的——一切看起来都正常,只是你的更新没有传导过去。整条链路见GEO 怎么做:先过搜索引擎的五道关,发现环节的三条通道见AI 爬虫是怎么发现你的网站的

常见疑问

问:我的站只有几千个页面,要不要管抓取预算?

不用。Google 给的门槛是「每周更新的百万页级站点」或者「每天更新的万页级站点」,几千页的站远在门槛之下。这类站如果爬虫来得少,原因基本不是额度不够,而是引擎没觉得你值得常来,或者压根没发现你的新页面。先去查发现和抓取那两关。

问:怎么知道爬虫有没有在浪费额度?

看服务器日志,按 User-Agent 分组,统计每个爬虫命中的地址类型分布。正文页占比很低、静态资源或参数地址占大头,就是浪费。这是事实判断,不需要任何工具估算。

问:屏蔽参数地址会不会误伤?

会,所以要先看清楚。有些参数地址是有独立价值的,挡掉等于让那部分内容整个消失。稳妥的顺序是:先用 canonical 合并,观察一段时间,确认没有流量依赖,再考虑挡。

问:服务器变快了,爬虫会来得更多吗?

可能会,但不一定。速率是上限,需求才是实际用量。如果引擎本来就没打算多抓你,提高上限用不上。响应速度值得修,但别指望它单独解决问题。

问:抓取预算和收录量是一回事吗?

不是。抓取预算管的是「来抓多少次」,收录量管的是「抓回去之后存了多少页」,分属第二关和第三关。抓得多不代表存得多,抓得少却肯定存不多。两个数要分开看,见收录和排名的区别:怎么查自己卡在哪一关

---

想知道爬虫在你的站上把额度花在了哪儿?免费诊断一次,我们会读你站点的可抓取性与收录状况并给出清单。