robots屏蔽无效爬虫恢复搜索引擎收录

很多站长为了节省服务器带宽,会在 robots.txt 里屏蔽各种无效爬虫。
但一个不小心,连搜索引擎的爬虫也拦在外面,导致收录暴跌。
本文就针对这个情况,讲清楚 怎样屏蔽无效爬虫的同时,快速恢复搜索引擎收录

操作前需要准备什么

  • 能修改网站根目录下的 robots.txt 文件。如果你用的是宝塔面板,在“文件”里就能直接编辑;如果是自己管理的服务器,用 FTP 或 SSH 都行。
  • 知道哪些爬虫是搜索引擎的:
  • 百度:Baiduspider
  • 谷歌:Googlebot
  • 必应:Bingbot
  • 搜狗:Sogou web spider
  • 准备一个在线 robots.txt 测试工具(比如百度资源平台里的测试功能)。

分两步走:先恢复收录,再屏蔽无效爬虫

第一步:检查当前 robots.txt 是否误拦了搜索引擎

先看看你的 robots.txt 里有没有类似这种配置:

User-agent: *
Disallow: /

User-agent: * 表示匹配所有爬虫,Disallow: / 就是禁止访问全站。
这个配置会直接导致所有搜索引擎无法抓取你的网站,收录必然为零。

另外也要看有没有单独禁止特定搜索引擎的行,比如:

User-agent: Googlebot
Disallow: /

这种情况要立刻删除或修改。

第二步:正确配置:允许搜索引擎,屏蔽无效爬虫

正确的逻辑是用两条规则:

  1. 先允许已知的搜索引擎爬虫访问全部内容。
  2. 再禁止其他所有爬虫访问(可选)。

推荐写法如下(直接在 robots.txt 中替换原有内容):

User-agent: Baiduspider
Disallow:

User-agent: Googlebot
Disallow:

User-agent: Bingbot
Disallow:

User-agent: Sogou web spider
Disallow:

User-agent: *
Disallow: /

注意:Disallow: 后面不加路径表示允许访问全部。
而最后的 User-agent: * 规则只影响前面没列出的爬虫,不影响已经明确的搜索引擎。
把这份文件保存并上传回网站根目录。

如果你使用的是 宝塔面板,操作路径是:

  • 登录宝塔 → 文件 → 找到网站根目录(通常在 /www/wwwroot/你的域名/)→ 右键 robots.txt 编辑 → 粘贴上面的内容 → 保存。

第三步:测试并提交收录

修改完成后,马上用工具测试:

  • 百度站长平台 → robots.txt 检测。
  • Google Search Console → 测试 robots.txt。

确认所有搜索引擎都显示“允许抓取”后,手动提交一次 URL 或站点地图,加速收录恢复。

避坑指南(一定要看)

  • 不要用 User-agent: *Disallow: 放一起,上面的例子中 User-agent: * 必须配合 Disallow: / 才能只屏蔽无效爬虫,否则会默认允许所有。
  • 注意大小写:爬虫名一般是首字母大写,但实际对大小写不敏感,不过建议按官方写法。
  • 屏蔽无效爬虫后,服务器日志里依然会有访问记录,那是正常的,只是爬虫看到 Disallow 后不会抓取内容,但依然会请求 robots.txt
  • 如果收录在修改后几天内没有恢复,检查一下是不是被其他手段屏蔽了,比如 .htaccess、Nginx 配置里的 IP 限制或 CDN 防火墙规则。

如何确认搜索引擎已经恢复爬取

方法一
查看网站访问日志(或宝塔面板的“网站监控报表”),
搜索 BaiduspiderGooglebot 等词,
如果能看到 200 状态码的 GET 请求,
说明爬虫已经正常访问了。

方法二:在百度资源平台或 Google Search Console 里查看“抓取统计”,看近几天的抓取量是否有明显回升。

方法三:直接搜索 site:你的域名,看结果数量有没有增加。
一般三五天后就会有变化。

高频问题解答

Q:我按上面写了,但百度还是不收录怎么办?
A:先检查百度资源平台里有没有错误提示,同时确认网站没有因为其他原因被惩罚。另外,新站收录本身就需要时间。

Q:如何知道哪些爬虫是无效的?
A:查看服务器日志,把非搜索引擎的 User-Agent 记录下来(比如一些扫描器、采集器),然后决定是否屏蔽。不要盲目屏蔽所有不认识的。

Q:修改 robots.txt 后多久生效?
A:爬虫定期会重新抓取 robots.txt,一般在几小时内生效。如果想加快,可以主动在站长平台提交。

最后总结

屏蔽无效爬虫节省资源没有问题,但一定要先确保搜索引擎的爬虫畅通。
本文的配置方案已经经过了大量站点验证,你可以直接使用。
如果之后发现新的无效爬虫,只需要在 User-agent: * 之前增加对应的允许规则即可。

分享到:
上一篇
用带宽限速脚本限制爬虫占用服务器流量,零基础实操教程
下一篇
离线宝塔面板无网络家用主机部署教程
1
系统公告

机房迁移升级通知

尊敬的用户: IP 段 103.23.148.x、156.224.29.x 原香港一区线路波动、攻击频繁,平台定于 7 月 5 日凌晨分批迁移至香港 GIA 机房,硬件升级 AMD 铂金机型。 迁移均在凌晨操作,最大程度降低业务影响,迁移期间服务器临时关机; 升级后配置不降低、费用不涨价,数据默认同步迁移; 迁移后 IP 全部更换,请及时修改域名解析、防火墙白名单; 建议提前备份重要数据,有问题可联系在线客服。 感谢理解与支持! 泽御云科技 2026.06.30
服务中心
客服
在线客服
24小时为您服务
咨询
联系我们
联系我们,为您的业务提供专属服务。
24/7 技术支持
如果您遇到寻求进一步的帮助,请过工单与我们进行联系。
24/7 即时支持
泽御云
售前客服
泽御云
泽御云
售后客服
泽御云
技术支持
评价
您对当前页面的整体感受是否满意?
😞
非常不满意
😕
不满意
😐
一般
🙂
满意
😊
非常满意