外贸站宝塔面板网站robots屏蔽垃圾爬虫恢复收录
外贸站依赖搜索引擎获取海外客户,但网站若被大量垃圾爬虫(如 SemrushBot、DotBot)频繁抓取,会消耗服务器资源,导致正常搜索引擎(Google、Bing)的爬虫被挤占,最终收录下降甚至不收录。
本文教你在宝塔面板中通过修改 robots.txt 屏蔽垃圾爬虫,亲手恢复收录。
垃圾爬虫到底是什么
垃圾爬虫指那些不遵守 robots 协议、反复抓取页面且对 SEO 无益的爬虫。
它们会占用带宽和 CPU,影响真实用户访问和搜索引擎正常收录。
常见的垃圾爬虫 User-agent 有:SemrushBot、AhrefsBot、DotBot、MJ12bot、BLEXBot、DataForSeoBot、MegaIndex 等。
在 robots.txt 中禁止它们访问即可。
宝塔面板中编辑 robots.txt 的两种方式
首先确保宝塔面板已安装并绑定好域名,网站已正常运行。
方式一:通过宝塔网站设置编辑
- 登录宝塔面板,进入「网站」页面。
- 找到目标外贸站域名,点击右侧「设置」。
- 在弹出窗口选择「配置文件」选项卡。
- 文件列表中找到
robots.txt(如果不存在,可手动创建)。 - 直接编辑并保存。
方式二:使用 SSH 或文件管理器
若宝塔内没有可视化编辑器,可用文件管理器访问 /www/wwwroot/你的域名/,找到或新建 robots.txt。
推荐使用的屏蔽规则示例
复制以下内容到你的 robots.txt,替换或追加即可。
注意:保留对好爬虫(Googlebot、Bingbot)的允许规则。
User-agent: SemrushBot
Disallow: /
User-agent: AhrefsBot
Disallow: /
User-agent: DotBot
Disallow: /
User-agent: MJ12bot
Disallow: /
User-agent: BLEXBot
Disallow: /
User-agent: DataForSeoBot
Disallow: /
User-agent: MegaIndex
Disallow: /
User-agent: *
Disallow:
最后一段 User-agent: * 表示对所有未列出的爬虫(包括正常搜索引擎)保持允许,避免误伤。
如果你已经用其他插件或 CDN 屏蔽了特定 IP,也可以结合使用。
避坑指南:别把好爬虫也屏蔽了
- 语法错误:每个
User-agent必须单独成段,不能写在一行。Disallow: /表示禁止全站,Disallow:(空)表示允许。 - 屏蔽 Googlebot 等:若错误屏蔽了主流搜索引擎,收录会立刻停止。建议修改后用 Google Search Console 的「robots.txt 测试工具」验证。
- 生效时间:修改后立即生效,但爬虫下次抓取时才会读取新规则,通常 1-2 天内垃圾爬虫会减少。
- 缓存问题:部分 CDN 或缓存插件可能会缓存旧的 robots.txt,建议清除缓存。
如何验证垃圾爬虫是否被屏蔽
- 直接访问:在浏览器中输入
https://你的域名/robots.txt,检查是否返回正确内容(含屏蔽规则)。 - 查看服务器日志:宝塔面板「监控」或直接查看
/www/wwwroot/你的域名/logs/下的访问日志,搜索垃圾爬虫的 User-agent,观察是否仍有 200 请求。 - Google Search Console:打开「robots.txt 测试工具」,输入网址并点击测试,检查是否有警告或误拦。
- 观察收录变化:修改后 1-2 周内留意 Search Console 中收录状态,若开始增加说明有效。
常见问题解答
Q:修改 robots.txt 后多久能恢复收录?
A:不会立刻恢复,但垃圾爬虫减少后,好爬虫能更顺利抓取,收录通常会在 1-3 周内逐步恢复,具体取决于网站权重和内容质量。
Q:不小心屏蔽了 Googlebot 怎么办?
A:立即删除对应规则,保存后刷新缓存。Google 通常在 24 小时内重新抓取 robots.txt。
Q:除了 robots.txt,还有其他方法屏蔽垃圾爬虫吗?
A:可以结合宝塔防火墙、CDN 或 .htaccess 根据 IP 和 User-agent 屏蔽,但 robots.txt 是最简单有效的方式。
Q:外贸站是否还要屏蔽百度爬虫?
A:如果你主要做海外市场,可以屏蔽百度爬虫(Baiduspider)以节省资源,但需要确认不依赖百度流量。
如果你正在处理外贸站收录问题,建议按本文步骤完整操作后,再配合优化页面速度和外链建设,效果会更好。