中国日报
这通常是因为百度会在不同时间、不同IP下多次抓取同📢一页面,并对比用户侧和爬虫侧的内容
通常的优化方法是:对爬虫请求设置较长的缓存时间(比如10分钟),并在页面内容更新时主动刷新缓存
建议在Nginx层对爬🔍虫IP做简单的速率限制,或者配置一个独立的轻量渲☀️染池专供爬虫使用
避坑一:User-Agent识别列表并非越全越好 部分站🌺长会在Nginx或Node层维🎊护一个长长的爬虫UA列表,甚至连Googlebot、Bingbot都加了进来,却唯独漏掉了百度移动端爬虫
设为首页
关于百度
About Baidu
使用百度前必读
帮助中心
© Baidu
京ICP证030173号
京公网安备11000002000001号