南方都市报
txt中禁用的路径: 页面类型 示例路径 屏蔽理由 后台管理 /admin/、/manage/ 无收录价值,且存在安全隐患 用户登录😎/注册 /lo🌅gin、/register 动态页面,对搜索无意义 购物车/结账 /cart、/checkout 需用户操作,爬虫无法正常访问 站内搜索结果 /search
上传后,直接在浏览器访问 你的域名/robots
大小写敏感: 路径的大小写通常与服务器配置有关,建议统一使用小写,确保兼容
这些页面不仅无法带来有效排名,还会消耗爬虫⭐的抓取配额,导致重要内容页面被遗漏或抓取频率降低
例如,以下规则表示禁止所有百度Spider抓取/admin/目录下的内容: User-agent: Baiduspider Disallow: /admin/ 常见需要屏蔽的无用页面类型 根据网站类型的不同,需要屏蔽的页面也有所差异
Disallow: /tag/ User-agent: * Disallow: /cgi-bin/ 注意: User🔑-agent: Baiduspider 专为百度Spider设置,而 User-agent: * 则适用于其他爬虫,通常建议⭐对所有爬虫屏蔽后台及cgi-bin等无意义目录
确认无误后,将文件📢通过FTP或服务器文件管理工具上传到网站根目录
建议持续观察百度搜索资源平台中的抓取数据,一般2至4周后,可以看到屏蔽目录的抓取次数明显下降,而核心内容页面的抓取频率有所提升
txt文件 明确屏蔽这些无用页面,可以让百度Spider将精力集中在真正需要收录的内容上,从而优化站点在百度搜索结😎果中的表现
无实际内容,仅💡用于后端交互 编写针对百度的屏蔽规则详细步骤 第一步:分析站点无用URL模式 使用百度搜索资源平台或网站日志工具,梳理出所有被Spider抓取的URL,标记出那些点击率极低、会生成大量重复页面、或者明显无SEO价值的URL模式
在屏蔽大范围路径时,可以用📢All💯ow开放某个特定子路径
区分目录与🔑▶️文件: Disallow后的路径如果是目录,末尾需要加斜杠,例如 /category/ ;如果是具体文件,则不加斜杠,例如 /login
txt协议,但某些情况下(如网站被黑或存在违规内容)也可能忽略部分规则
q= 重复内容多,容易造成抓取浪费 标签/分类分页 /tag/、/category/page/2/ 内容重复度高的低价值页面 动态脚本或API /api/、/*
txt只是告❤️诉爬虫不要🔑抓取,但并不能阻止恶意访问