南方都市报
常见的做法是通过 User-Agent 检测,或向百度爬虫开放特定 API 端点
当检测到爬虫访问时,服务器返回纯 JSON 响应;当检测到普通浏览器时,仍然返💡回完整 HTML 渲染页面
适用范围与理性评估 全 JSON 数据协议并非适用于所有网站
然而,随着前端框架的普及和动态内容需求的增长🚀,单纯依赖 HTML 渲染越来越难以满足爬虫对数据的即时需求
这一方法能大幅降低爬虫解析页面结构的负担,让核心数据以结构化形式直达索引库
设计 JSON 数据结构 JSON 数据应包含以下必要字段: title :页面标题 content :正文内容(纯文本或带标签的结构文本) links :页面内主要链接(如导航、相关文章) meta :关键词、描述、发布时间等元信息 status :页面状态码(200、404 等) 结构应尽量扁平,避免过深的嵌套,让爬虫能快速遍历
配置 URL 规则与响应头 为确保爬虫正确识别 JSON 数据,需要在 HTTP 响应头中设置 Content-Type: applica😎tion/json ,并在 URL 或自定义头部中标注协议版本