人民日报
常见的跳转链条结构如下: 入口域名(A)→ 中间跳转层1(B)→ 中间跳转层2(C)→ 最终目标页(D) 蜘蛛抓取A时,会被重定向到B,B再重定向到C,最终指向D 不同层级的跳转采用不同的响应状态码或延迟机制,旨在让爬虫在多次跳转中“消耗资源”,同时让目标页面获得来自多个来源的抓取请求
- 第三层跳转:返回200状态码并加载目标页面内容,或通过JavaScript重定向进一步过滤非JS爬虫
设为首页
关于百度
About Baidu
使用百度前必读
帮助中心
© Baidu
京ICP证030173号
京公网安备11000002000001号