南方都市报
结合User-Agent与请求特征做差异化限速 百度爬虫的User-Agent通常包含“Baiduspider”字样
例如: 对含有🍀“Baidu💫spider”的请求,限制每秒最多5个请求,突发峰值不超过10个
百度的爬虫通常遵守该指令,如果服务器允许,可在robots
百度爬虫需要一定的带宽来完成抓取任务,过低的限速可能导致站点页面在搜索结果中的收录延迟或不全
常见的初始值: 每I☀️P每秒不超过10次请求,突发量不超过20次 💡,后续可根据服务器承载能力浮动
当百度爬虫访问💎这类站点时,其请求会经由✅负载均衡器分发到多台后端服务器
重要提醒:在调整限速策略时,务必先🌟在小🎆范围灰度测试,确认无误后再全量上线
此时需要将限速前置到负载均衡层,或采用🔍更精确的识别方式
注意事项:限速参数的合理调整 限速并非越低越好
txt中 Crawl-delay 指令的作用
此方法实现简单,但需🔥要后端程序支持,且要注意伪造头✨部风险——常见做法是 信任负载均衡器添加的头部,并清除客户端自带的同名头部