先说结论,省得你白读:绝大多数网站不需要关心抓取预算。
这不是我们的判断,是 Google 自己在面向大型站点的那份指南开头写的原话——如果你的站没有大量快速变化的页面,或者你的页面基本上发布当天就被抓走了,这份指南你不用读。
中文世界里这个概念被传得很热,但它真正的适用范围窄得超出多数人的想象。
先讲边界,再讲原理,是因为顺序反了会浪费你的时间:小站花几周去「优化抓取预算」,通常什么也改变不了,真正卡住的是别的关卡。
一、它是什么
引擎不会无限制地抓你的站。它每天愿意在你这儿花多少次请求,大致由两个因子相乘决定:
抓取速率上限——你扛不扛得住。 引擎会试探性地加大并发,如果你的服务器响应变慢或者开始报错,它就退回去。所以服务器越快越稳,同样的时间窗口里它能抓的页面就越多。
抓取需求——你值不值得抓。 你的内容更新得频不频繁、历史上抓回去的东西有多少真被用上了、这个站在引擎眼里有多重要。一个半年不更新的站,引擎没有理由天天来。
两个因子里,第二个通常才是瓶颈。很多人以为加带宽、上 CDN 就能让爬虫多来,实际上如果引擎压根不觉得你值得频繁抓,速率上限提得再高也用不上。
二、谁真的需要管
Google 给的门槛比多数人想的高得多,而且是有具体数字的:
| 情况 | 门槛 |
|---|---|
| 大型站,内容中等频率更新(比如每周) | 100 万个以上独立页面 |
| 中型及以上,内容变化极快(每天) | 1 万个以上独立页面 |
| 站长平台里「已发现 — 尚未编入索引」占比很高 | 不看规模 |
前两条几乎把所有企业官网、内容站排除在外了。一个几千页的站去优化抓取预算,通常是在解决一个自己并不存在的问题——真正卡住它的多半在别的关卡。
第三条是唯一不看站点规模的判据,也是最实用的一条:引擎已经知道有这些地址,却迟迟没去抓。它是事实,不是推测。
除此之外还有一种情况值得看一眼:日志里爬虫来得不少,但抓的全是些无关紧要的地址。这不是规模问题,是浪费问题,下一节讲怎么认。
三、额度被浪费是什么样子
去服务器日志里按 User-Agent 分组,统计每个爬虫命中的地址类型分布:正文页占多少、静态资源占多少、参数地址占多少。
健康的样子是正文页占大头。不健康的形态有这么几种:
- 参数地址吃掉大半。同一个商品列表因为筛选条件不同,被当成几十个不同地址反复抓。
- 跳转链吃掉额度。每一跳都是一次完整请求。一条
http → https → 带斜杠 → 最终地址的链,四次请求才拿到一个页面。 - 死链反复被抓。引擎会隔一段时间回来确认它是不是真的没了,一条 404 能消耗很久的额度。
- 最极端的一种:某个爬虫反复命中同一个静态脚本文件,正文页一个都没进。它的额度全花在一个死胡同上——脚本文件里没有链接,爬到那儿就走不下去了。这不是假设,各家爬虫在同一个站上的实际表现,实测见爬虫到访观测 2026-08 期。
四、怎么省
按性价比排序:
- 先修服务器响应时间。 这一条同时改善两个因子,而且不需要动任何页面。
- 收拾跳转链。 让内链、站点地图、
canonical全部指向最终地址,别让爬虫走两跳三跳,见canonical 是什么:同一篇内容有多个地址会怎样。 - 处理参数地址。 能挡的用
robots.txt挡掉,不能挡的用canonical合并回主地址,见robots.txt 怎么读。 - 清理站点地图。 别把死链和低价值地址放进去,那等于主动把爬虫往那边引。
- 别用大量低价值页面撑数量。 这一条最反直觉:页面越多,单个页面分到的注意力越少。
五、落回 GEO:为什么 AI 还在用你的旧口径
抓取预算和 GEO 之间有一条不太明显、但很要紧的联系。
额度被吃光时,最先被牺牲的是最新的内容。 引擎按它自己的优先级排队,新发的、刚改的那些排在后面,而 AI 引用的是它索引里那一版。
于是就有了这个常见现象:你已经把官网上的品牌介绍改了,AI 回答时却还在用几个月前那一版的说法。很多时候原因不在 AI,在于那一版根本没被重新抓过。
这也是为什么第二关(抓取)值得单独拿出来看:它不像收录那样有个明确的数字可查,出问题时是悄悄失效的——一切看起来都正常,只是你的更新没有传导过去。整条链路见GEO 怎么做:先过搜索引擎的五道关,发现环节的三条通道见AI 爬虫是怎么发现你的网站的。
常见疑问
问:我的站只有几千个页面,要不要管抓取预算?
不用。Google 给的门槛是「每周更新的百万页级站点」或者「每天更新的万页级站点」,几千页的站远在门槛之下。这类站如果爬虫来得少,原因基本不是额度不够,而是引擎没觉得你值得常来,或者压根没发现你的新页面。先去查发现和抓取那两关。
问:怎么知道爬虫有没有在浪费额度?
看服务器日志,按 User-Agent 分组,统计每个爬虫命中的地址类型分布。正文页占比很低、静态资源或参数地址占大头,就是浪费。这是事实判断,不需要任何工具估算。
问:屏蔽参数地址会不会误伤?
会,所以要先看清楚。有些参数地址是有独立价值的,挡掉等于让那部分内容整个消失。稳妥的顺序是:先用 canonical 合并,观察一段时间,确认没有流量依赖,再考虑挡。
问:服务器变快了,爬虫会来得更多吗?
可能会,但不一定。速率是上限,需求才是实际用量。如果引擎本来就没打算多抓你,提高上限用不上。响应速度值得修,但别指望它单独解决问题。
问:抓取预算和收录量是一回事吗?
不是。抓取预算管的是「来抓多少次」,收录量管的是「抓回去之后存了多少页」,分属第二关和第三关。抓得多不代表存得多,抓得少却肯定存不多。两个数要分开看,见收录和排名的区别:怎么查自己卡在哪一关。
---
想知道爬虫在你的站上把额度花在了哪儿?免费诊断一次,我们会读你站点的可抓取性与收录状况并给出清单。