凤凰网
观察百度搜索中的“抓取异常”报告,如果发现大量页面被意外屏蔽,及时调整规则
当网站改版、新增敏感目😎录、或临时需要屏蔽某些页面(如测试环境)时,都应同步更新该文件
txt 文件,以确定哪些页面允许抓取、哪些页面禁止访问
com ): User-agent: Baiduspider Disallow: /admin/ Disallow: /temp/ Disallow: /cgi-bin/ Allow: /public/ User-agent: * Disallow: /admin/ Disallow: /cgi-bin/ Sitemap: https://example
百度爬虫在抓取网站前,会首先检查根目录下的 robots
Sitemap :指定网站地图的绝🍀对路径,方便🎇爬虫快速发现页面
本教程将基于百度搜索的官👍方指南,结合实际运维经验,带你一步步完成正确配置
重复或冲突规则 :当有多条 User-agent 规则时,爬虫一般会优先匹配最具体的名称
对其他搜索引擎,只禁止后台和管理目录,避免过度限制普通爬虫
需要注意: 每条指令应单独一行,大小写敏感,路径必须以斜杠“/”开头
可以写具体文📌件或目录,如 /admin📢/ 或 /private/
对百度应使用 Baiduspider ,若希⚡望规则适用于所有爬虫,可写 *
输入想要测试的链接地址,系统会返回该链接是否能被百度爬取,以及具体是被哪条规则拦截