凤凰网
txt是存放在网站根目录▶️下的一个纯文本文件,用来告诉搜索引🎵擎爬虫哪些页面可以抓取、哪些不可以
上线后务必📌去掉全局屏蔽,或使💡用 Allow 指令配合
这样能帮助🍀爬虫更全面地发现新内容,尤其适用于内容较多的教程网站
这个规则会禁止🎨所有搜🔑索引擎爬虫访问站内任何路径
误区四:忽略Sitemap的引用 Robots文💎件除了声明禁止抓取🎨的目录,还应当提供Sitemap(站点地图)的链接,例如 Sitemap: https://www
路径是区分大小写的,⚡比如 /Admin/ 和 /admin/ 会被视为两个不同路径
例如: User-agent: Baiduspider Allow: / Disallow: /admin/ User-agent: * Disallow: /temp/ 这样可以让百度蜘蛛获得更宽松的权限,而其他爬虫依然被限制在临时目录之外
误区三:滥用“Us💯er-agent: *”后面的规则 很多教程会教大家用 User-agent: * 来覆盖所有爬虫
但如果你同时需要为百度单独设置指定规则(比如允许深度抓取),😎就需要将百度(Baiduspider)的规则放在最前面,或者明确❤️写多条User-agent记录