和十个seo聊天,会有九个不知道或者不清楚什么是Crawl Budget。Crawl Budget(抓取配额)偏偏是Technical SEO中的核心概念。本篇我们将“粗略”介绍一下Crawl Budget的概念。开始讲了,请搬好小板凳……
So WTF is Crawl Budget?顾名思义Crawl Budget是搜索引擎为你的网站制定的一个抓取频次的预算。任何一个搜索引擎对任何一个已发现的网站都会有一个动态且唯一的Crawl Budget。
上图是笔者在2018年参加SMX East时,Bing对Crawl Budget的定义。正如Bing所言,Crawl Budget是爬虫所认为的在不伤害你的网站性能的情况下能投入的最大抓取量。
Crawl Budget决定了该搜索引擎在单位时间里对你的网站资源请求多少次,花多少时间爬取和渲染。
请注意这里的网站是指一个host,换句话说,maxket.com和www.maxket.com是两个hosts。分别享有不同的Crawl Budget。而且就像Bing所言,Crawl Budget不单单针对一个个域名,而且会针对一个IP或者IP段。
搜索引擎干嘛要弄个Crawl Budget?因为人家也是交水电煤房租网费的,没空花时间花资源来爬个垃圾站。
这么说可能深深地刺痛了你的自尊心,但是搜索引擎的爬取资源毕竟不是无限的。您可去多爬几次重要的页面看看有没有更新也不会对垃圾网站的页面花一点点时间。
那SEO为什么要关注Crawl Budget呢?搜索引擎爬取一个页面通常有两个原因触发:
- 搜索引擎发现了新页面。搜索引擎对长期未重新爬取的页面进行再确认,保持新鲜度。如:看看页面还在不在,有没有新增加的内容,有没有改版等等。
这两个原因提升了抓取需求(Crawl Demand)。也就是搜索引擎觉得你的网站更需要去爬一下了。通常来说中小网站(<10,000页面)是不需要过多关注Crawl Budget的。但这也不是绝对的。
首先是怕漏爬。由于出现技术问题导致中小网站出现大量重复网页,让真正需要被爬取和索引的页面“翻不了牌子”。其次是怕迟爬。当爬行配额不足时,往往搜索引擎会无法及时爬取新内容。这样对时效性较强的内容来说是一种损失。除了抓取需求还有一个概念叫作抓取率限制(Crawl Rate Limit)。它决定了某一个网站的平行并发连接数和期间等待的时间,它又由两个因素决定:
- 抓取的健康度:如果站点响应很快一段时间,则限制会增加,这意味着可以使用更多连接进行爬网。 如果网站速度变慢或响应服务器错误,则限制会下降并且爬虫会抓取更少的内容。你在搜索控制台中设置限制:网站所有者可以减少爬虫对其网站的抓取。 请注意,设置更高的限制不会自动增加抓取。
Crawl Budget并没有一个明确的单位,我们可以大概理解为搜索引擎“花多少心思和工夫来了解你的网站”。要回答这个问题,我们要了解哪些资源会占用Crawl Budget。
除了HTML页面之外,其他页面包含的资源如图片、JS、CSS。另外alternate标签中的URL比如其他语言的URL或者AMP、MIP页面,还有Ajax自动发生的请求(如果该引擎去渲染页面)也会被算入。
概括地说凡是你能够在网站访问日志看到的来自爬虫的请求都会消耗你的抓取配额。
如何提升自身网站的Crawl Budget呢?Crawl Budget的上限完全由你的网页在搜索引擎眼中的重要性决定。它由搜索引擎对你的网站/网页的抓取需求(Crawl Demand)来决定。用Matt Cutts的话说:
The best way to think about it is that the number of pages that we crawl is roughly proportional to your PageRank. So if you have a lot of incoming links on your root page, we’ll definitely crawl that. Then your root page may link to other pages, and those will get PageRank and we’ll crawl those as well. As you get deeper and deeper in your site, however, PageRank tends to decline.(考虑它的最佳方式是我们抓取的页面数量与您的PageRank大致成比例。 因此,如果您的根页面上有很多外链,我们肯定会抓取它。 然后你的根页面可以链接到其他页面,那些将获得PageRank,我们也会抓取它们。 然而,随着您的网站越来越深入,PageRank往往会下降。)
另外,当我们网站改版的时候,搜索引擎会发现网页和索引中的不一样了,这会触发大量重新爬取。就像上图所讲的,Your Mileage May Vary,你的消费量可能不一样,Crawl Budget是一个动态的值。
总之,就像下图所概括的那样,当网站较小时,不管SEO做得好不好,大部分情况下Crawl Budget会大于Crawl Demand,也就是配额大于需求。而当网站较大时,配额要小于需求,那就会出现我们上面提到的漏爬和迟爬的现象了。
那么既然我们只能通过提升PageRank来提升网站的Crawl Budget那么我们谈Crawl Budget还有什么意义?意义就是你可以至少避免浪费啊,一块钱当两块钱花。
浪费Crawl Budget的情况有哪些?要避免浪费就要了解浪费Crawl Budget的情况有哪些。