北京日报
常见做法包括: 查询IP的😎PTR记录,💯若域名解析为 *
使用验证码或JavaScript挑战进🔥行分层放行 对于疑似恶意但🎨无法确认的访问,可启用轻度验证(如简单数学题或滑块验证)
注意此方法仅用于🎇二次确🌈认,不能直接用于百度爬虫,因为爬虫无法执行JavaScript或完成验证码
以下提供几类经过验证的实操方法,适用于不同规模的站点: 1
txt中直接禁止所有爬虫 百度完全无法抓取,收录归零 仅禁止不必要路径(如后台、API),保留核心内容路径 对所有高频IP统一封锁 误伤百度爬虫,抓取频率骤降 建立白名单机制,精确放行Baiduspider 过度依赖CDN层面的反爬规则 CDN可能将爬虫请求拦截在边缘节点 在CDN后台添加百度爬虫IP白名单或UA规则 未设置Crawl-delay 爬虫抓取过快,服务器负载升高 在robots