百度搜索引擎优化:多层跳转蜘蛛池的原理与风险说明



常见的跳转链条结构如下: 入口域名(A)→ 中间跳转层1(B)→ 中间跳转层2(C)→ 最终目标页(D) 蜘蛛抓取A时,会被重定向到B,B再重定向到C,最终指向D 不同层级的跳转采用不同的响应状态码或延迟机制,旨在让爬虫在多次跳转中“消耗资源”,同时让目标页面获得来自多个来源的抓取请求



- 第三层跳转:返回200状态码并加载目标页面内容,或通过JavaScript重定向进一步过滤非JS爬虫



举报/反馈