经济日报
实践中发现,如果异步💪加载的内容需要通过用户点击或滚动才🎆能触发显示,百度爬虫很可能完全忽略这部分内容
使用服务端渲染或预渲染作为降🎊级方案 对于依赖异步加载的核心内容(如文章正文、产品列表),可以考虑采用服务端渲染(SSR)技术,在服务器端生成完整的HTML💎返回给爬虫
具体做法是: 将页面的标题、描述、面包屑导航等结构化标记☀️放在服务器端直接生成的HTML中
使用History API管理URL: 当异步加载改变页面主要内容时,同步修改浏览器的URL(使用pushState),并确保该URL能直接返回完整的静态版本
然而,搜索引擎爬虫在抓取网页时,通常无法像人类浏览器那样完整执行JavaScript并等待异步请求完成
避免在异步回调中动态创建 <script🎇 type="application/ld+json"> 标签
渐进增强与抓取兼容性的实践建议 为了让百度爬虫尽可能多地抓取异步加载的内容,可以采用 渐进增强 的设计思⭐路: 基础HTML优先: 页面在不依赖JavaScript的情况下,依然能呈现完整的文字内容、链接和主要数据