网站robots屏蔽无用爬虫修复收录

如果你的网站明明内容没问题,但收录却越来越少,很可能是被大量无用爬虫(比如 AI 训练爬虫、采集工具、恶意扫描器)占用了服务器带宽和抓取配额。
通过合理设置 robots.txt,可以快速过滤掉这些爬虫,把宝贵的抓取资源留给搜索引擎。
本文面向零基础用户,手把手教你完成屏蔽操作,附带常见错误分析和效果检查方法。

找到网站 robots.txt 文件

大多数建站环境(Nginx、Apache、宝塔面板、cPanel)都默认可通过根目录访问 robots.txt。
你只需要:

  • 使用 FTP 工具或服务器面板的文件管理器,进入网站根目录(通常为 /www/wwwroot/你的域名/var/www/html)。
  • 查看是否存在 robots.txt 文件。如果没有,新建一个即可。
  • 备份原文件(如果能找到),避免误操作后无法恢复。

如果使用宝塔面板,可以直接在“文件”页面对应目录右键新建文件。

编写屏蔽规则:针对常见无用爬虫

打开 robots.txt,你需要按以下格式写入 User-agentDisallowUser-agent 是爬虫的名字,Disallow: / 表示禁止爬取全站。

推荐屏蔽的几类爬虫(可根据你的日志调整):

  • Bytespider(字节跳动 AI 爬虫)
  • SemrushBot(SEO 工具爬虫)
  • MJ12bot(Majestic 爬虫)
  • AhrefsBot(外链工具爬虫,如果不需要让它们抓取)
  • GPTBot(OpenAI 训练爬虫)
  • Claude-Web(Anthropic AI 爬虫)
  • Amazonbot(亚马逊产品爬虫)
  • DotBot(一些流量分析工具)

将它们按组写入同一个 User-agent 是不行的,必须每个爬虫单独一段。
示例:

User-agent: Bytespider
Disallow: /

User-agent: SemrushBot
Disallow: /

User-agent: GPTBot
Disallow: /

User-agent: MJ12bot
Disallow: /

如果你还想保留部分搜索引擎但阻止某些爬虫,可以保留 GooglebotBingbotBaiduspider 的访问权限(它们默认会遵守规则)。
为了保险,在文件末尾加上:

User-agent: *
Allow: /

确保不会误封所有爬虫。

避坑指南:避免屏蔽有效爬虫与语法错误

操作中最容易犯的三个错误:

  • 误判爬虫名称:不要凭印象写 Googlebot 写成 googlebot(大小写不敏感,但最好统一小写)。可以查看服务器日志中真实爬虫的 User-agent 全称。
  • 忘记换行:每条规则之间必须有一个空行,否则会被视为同一个规则块。
  • 屏蔽了正常搜索引擎:比如把 Baiduspider 也加了 Disallow: /,会导致百度无法收录。建议只针对明确不需要的爬虫进行屏蔽。
  • 测试前未清除缓存:搜索引擎和浏览器会缓存 robots.txt,修改后需要等待一段时间才能生效。可以到 Google Search Console、Bing Webmaster Tools 或百度搜索资源平台里提交 robots.txt 测试。

效果验证:检查爬取日志与收录变化

修改并上传 robots.txt 后,按以下步骤验证:

  1. 本地测试:在浏览器打开 https://你的域名/robots.txt,确认内容正确。
  2. 使用在线工具:访问“Google robots.txt tester”或“Bing robots.txt tester”,模拟爬虫查看是否被阻止。
  3. 检查服务器访问日志:使用宝塔面板的“网站监控”或 SSH 运行 tail -f /var/log/nginx/access.log,看原来高频率出现的爬虫(如 Bytespider)是否不再出现。
  4. 观察收录变化:一周后对比搜索引擎的收录数量(site:你的域名)。如果收录开始回升,说明屏蔽有效。

常见问题解答

Q:修改 robots.txt 后需要重启服务器吗?
不需要。搜索引擎会在下次抓取时自动重新读取 robots.txt。

Q:屏蔽爬虫后网站速度会立刻变快吗?
不一定,但屏蔽大量并发爬虫后,服务器负载会明显降低,网页响应速度有改善。

Q:如果我不确定哪些爬虫是无用的,怎么办?
先查看网站日志,筛选出访问频率高但从未带来转化的爬虫,再逐一屏蔽。

总结

通过合理配置 robots.txt 屏蔽无用爬虫,是修复网站收录成本最低的手段之一。
关键步骤是:找到文件、写入正确规则、测试生效。
如果你遇到收录问题,建议先按本文操作,结合日志持续优化。
遇到异常时,优先检查语法和缓存,再确认是否误封了正常搜索引擎。

分享到:
上一篇
宝塔面板PHP多版本兼容跨境站:宝塔面板PHP多版本设置技巧
下一篇
Docker容器跨主机数据迁移方案:从导出到恢复的完整实操
1
系统公告

机房迁移升级通知

尊敬的用户: IP 段 103.23.148.x、156.224.29.x 原香港一区线路波动、攻击频繁,平台定于 7 月 5 日凌晨分批迁移至香港 GIA 机房,硬件升级 AMD 铂金机型。 迁移均在凌晨操作,最大程度降低业务影响,迁移期间服务器临时关机; 升级后配置不降低、费用不涨价,数据默认同步迁移; 迁移后 IP 全部更换,请及时修改域名解析、防火墙白名单; 建议提前备份重要数据,有问题可联系在线客服。 感谢理解与支持! 泽御云科技 2026.06.30
服务中心
客服
在线客服
24小时为您服务
咨询
联系我们
联系我们,为您的业务提供专属服务。
24/7 技术支持
如果您遇到寻求进一步的帮助,请过工单与我们进行联系。
24/7 即时支持
泽御云
售前客服
泽御云
泽御云
售后客服
泽御云
技术支持
评价
您对当前页面的整体感受是否满意?
😞
非常不满意
😕
不满意
😐
一般
🙂
满意
😊
非常满意