北京日报
文件返回404或非纯文本📌格式(如被插件误输出HTML)都会导致爬虫无法读取,从而默认所有🍀页面可抓取或直接忽略网站
txt的文本文件,告诉🎵百度蜘蛛哪些页面可以抓取🎆,哪些页面应当避开
需要注意的是,百度爬虫默认会遵守标准的robots协议,但不同搜索引擎的爬虫对部分指令的理解可能有细微差异,因此建议以百度官方的开发者文档为准
例如 User-agent💯: Bai🚀duspider 针对百度爬虫; User-agent: * 适用于所有爬虫
建议先使用百度搜索资源平台的“robots工具”进行⭐校验,确保想要屏蔽的后台、测试页面等确实不可见,而核心内容页没有被错误屏蔽
这些页面被抓取会浪费抓取配额,且可能导致重复内容问题
例如 Disallow: /admin/🎊 禁止抓取admin目录下的内容
正确的写法是 Disallow: /temp/ ,而不是 Disallow: /te😎mp (后者可能导致匹配异常)
如果同时为 User-agent: Baiduspider 和 User-agent: * 设置规则,百度爬虫会优先匹配更具体的Baiduspider指令
Allow: 允🎯许爬虫访问🌟的路径,一般用于在Disallow范围内例外放行