robots屏蔽垃圾爬虫恢复网站收录

网站收录量突然上不去,甚至持续下降,排查服务器日志时发现大量陌生爬虫在疯狂抓取页面。
这些垃圾爬虫不仅消耗带宽和 CPU,还会挤占搜索引擎爬虫的抓取配额,导致正常收录被拖累。
今天我们就从零开始,用 robots.txt 精准屏蔽那些破坏收录的垃圾爬虫,从根本上改善网站收录状况。

动手前确认两件事

第一,你得有网站根目录下 robots.txt 文件的管理权限(如果文件不存在,可以用普通文本编辑器新建一个)。
第二,你需要知道哪些爬虫是“垃圾”的。
常见且被普遍认可的垃圾爬虫包括:SemrushBot、AhrefsBot、DotBot、MJ12bot、BLEXBot、Screaming Frog SEO Spider 等。
这些爬虫虽然有好的一面(用于 SEO 分析),但对普通小站点来说往往是负担,建议优先屏蔽。

tips:不放心的话,可以先查看网站访问日志,找出占流量前三的陌生 User-Agent,再去网络上确认是否属于有害爬虫。

编写屏蔽规则:在 robots.txt 里写清楚

打开网站根目录下的 robots.txt(如果没有就新建一个),用以下格式编写:

User-agent: SemrushBot
Disallow: /

User-agent: AhrefsBot
Disallow: /

User-agent: DotBot
Disallow: /

User-agent: MJ12bot
Disallow: /

User-agent: BLEXBot
Disallow: /

User-agent: Screaming Frog SEO Spider
Disallow: /

# 允许所有正常搜索引擎爬虫(保留通用规则)
User-agent: Baiduspider
Allow: /

User-agent: Googlebot
Allow: /

User-agent: *
Allow: /

关键说明:每个垃圾爬虫单独写一个 User-agent 块,然后 Disallow: / 表示禁止访问全站。User-agent: * 放在最后,表示所有未被明确禁止的爬虫(包括百度、谷歌)默认允许访问。
注意顺序:robots.txt 中更具体的规则优先于通用规则。

避坑:这些错误最容易被忽视

  • 误把搜索引擎写成了 Disallow:比如有人直接复制网上教程,把 User-agent: * Disallow: / 放在最前面,结果所有搜索引擎爬虫都被屏蔽。一定要把允许正常爬虫的规则写在后面。
  • 文件位置不对:robots.txt 必须放在网站根目录(如 public_html 或 www 目录下),否则不会被爬虫读取。
  • 语法错误:每行末尾不要有多余空格;User-agent 和 Disallow 必须独占一行;区分大小写,比如 Googlebot 首字母大写,Baiduspider 中间有小写。
  • 忽略缓存:修改 robots.txt 后,浏览器或 CDN 缓存可能导致旧版本仍然生效。建议强制刷新(Ctrl+F5)或清空 CDN 缓存。

验证屏蔽是否生效

  1. 直接浏览器访问:打开 https://你的域名/robots.txt,应该能看到你刚修改的规则。如果显示的是旧的或提示不存在,先检查文件路径和服务器配置。
  2. 使用网站日志分析:登录宝塔面板或 SSH 查看访问日志,过滤出被 Disallow 的 User-Agent,看它们是否还有 404 或 403 的记录(robots.txt 不会直接返回 403,但爬虫会停止抓取)。更简单的方法:利用百度站长平台或 Google Search Console 的“抓取统计”查看垃圾爬虫是否减少。
  3. 观察收录变化:屏蔽后,正常搜索引擎抓取配额会逐步释放,收录数据通常需要 1-2 周才能看到正向反馈。请保持耐心,同时确认站内内容质量无问题。

常见问题解答

Q:屏蔽垃圾爬虫后,为什么收录没有立刻恢复?
A:收录恢复需要时间,而且还要看原来是否有因服务器响应慢或内容质量下降导致的索引问题。robots.txt 只解决了爬虫拥挤问题,其他因素也要排查。

Q:哪些垃圾爬虫建议必封?
A:SemrushBot、AhrefsBot、DotBot、MJ12bot、BLEXBot 名气最大,如果服务器资源紧张,优先封这几个。

Q:能不能只封部分路径,不封全站?
A:可以,例如 Disallow: /wp-admin/ 只封后台。但针对垃圾爬虫,通常直接封全站效率最高。

Q:修改后百度不认?
A:百度严格遵守 robots.txt 协议,只要语法正确且文件可访问就会执行。可以到百度站长平台“抓取诊断”测试一下。

如果你正在处理 robots 屏蔽垃圾爬虫恢复网站收录的场景,建议先按本文步骤完整执行,然后通过日志和站长工具持续观察 1-2 周。
遇到异常时优先回看避坑和高频问题部分,往往能找到症结。

分享到:
上一篇
带宽限速防止爬虫耗尽服务器流量:服务器带宽总被爬虫跑光?手把
下一篇
离线宝塔面板无网络住宅主机部署:住宅主机无网络环境离线部署宝
1
系统公告

机房迁移升级通知

尊敬的用户: IP 段 103.23.148.x、156.224.29.x 原香港一区线路波动、攻击频繁,平台定于 7 月 5 日凌晨分批迁移至香港 GIA 机房,硬件升级 AMD 铂金机型。 迁移均在凌晨操作,最大程度降低业务影响,迁移期间服务器临时关机; 升级后配置不降低、费用不涨价,数据默认同步迁移; 迁移后 IP 全部更换,请及时修改域名解析、防火墙白名单; 建议提前备份重要数据,有问题可联系在线客服。 感谢理解与支持! 泽御云科技 2026.06.30
服务中心
客服
在线客服
24小时为您服务
咨询
联系我们
联系我们,为您的业务提供专属服务。
24/7 技术支持
如果您遇到寻求进一步的帮助,请过工单与我们进行联系。
24/7 即时支持
泽御云
售前客服
泽御云
泽御云
售后客服
泽御云
技术支持
评价
您对当前页面的整体感受是否满意?
😞
非常不满意
😕
不满意
😐
一般
🙂
满意
😊
非常满意