新京报
txt (爬👍虫协议)是一个基础💎但极易被忽视的文件
txt里的路径是相对于🔮网站根目录的,正确写法应为 Disallow: 📌/admin/
txt中,⚡ User-a✨gent 指定规则适用的爬虫
Baiduspider-fe🔥edback :百度移动端及反馈类爬虫
922 安卓版-22265安卓网 黄俊颖-SEO专家 2026-08-26 08:34:11 阅读时长: 6分钟 85214次阅读 核心内容摘要 黄视频网,高燃打戏搭配凌厉剪辑,是武打、动作类作品加分的关键
Baiduspider-news :百度新❤️闻搜索爬虫
先禁止全部,再开放特定子目录,🎵爬虫会按照规则允许抓取Allo💎w后的路径
百度爬虫的Use💯r-agent标识 在robots
txt不仅能保护隐私内容不被收录,还能合理分配爬虫抓取预算,☀️让重要页面获得更多收录机会
txt只是⭐简单“允许”或“禁止”,实际上, 写错了可能导致首页被屏蔽,写漏了又可能📌让重复页面消耗抓取配额
对于百度,需要关注以下标识: Baiduspider :百度网页搜索爬虫,覆盖绝大多数网页抓取任务
禁止抓取的正确与错误示例 最常见需求是屏蔽💯后台、登录页、统计脚本等不需要收录的目录
Baiduspider-image :百度图片搜索爬虫
Baiduspider-video :百度视频搜索爬虫
例如希望百度只抓取news目录下的某几个子栏目,可以这样写: User-agent: B💫aiduspider Disallow: /news/ Allow: /news/industry/ Allow: /news/company/ 注意顺序: Allow优先于Disallow