网站robots屏蔽无用爬虫修复收录
如果你的网站明明内容没问题,但收录却越来越少,很可能是被大量无用爬虫(比如 AI 训练爬虫、采集工具、恶意扫描器)占用了服务器带宽和抓取配额。
通过合理设置 robots.txt,可以快速过滤掉这些爬虫,把宝贵的抓取资源留给搜索引擎。
本文面向零基础用户,手把手教你完成屏蔽操作,附带常见错误分析和效果检查方法。
找到网站 robots.txt 文件
大多数建站环境(Nginx、Apache、宝塔面板、cPanel)都默认可通过根目录访问 robots.txt。
你只需要:
- 使用 FTP 工具或服务器面板的文件管理器,进入网站根目录(通常为
/www/wwwroot/你的域名或/var/www/html)。 - 查看是否存在
robots.txt文件。如果没有,新建一个即可。 - 备份原文件(如果能找到),避免误操作后无法恢复。
如果使用宝塔面板,可以直接在“文件”页面对应目录右键新建文件。
编写屏蔽规则:针对常见无用爬虫
打开 robots.txt,你需要按以下格式写入 User-agent 和 Disallow。User-agent 是爬虫的名字,Disallow: / 表示禁止爬取全站。
推荐屏蔽的几类爬虫(可根据你的日志调整):
Bytespider(字节跳动 AI 爬虫)SemrushBot(SEO 工具爬虫)MJ12bot(Majestic 爬虫)AhrefsBot(外链工具爬虫,如果不需要让它们抓取)GPTBot(OpenAI 训练爬虫)Claude-Web(Anthropic AI 爬虫)Amazonbot(亚马逊产品爬虫)DotBot(一些流量分析工具)
将它们按组写入同一个 User-agent 是不行的,必须每个爬虫单独一段。
示例:
User-agent: Bytespider
Disallow: /
User-agent: SemrushBot
Disallow: /
User-agent: GPTBot
Disallow: /
User-agent: MJ12bot
Disallow: /
如果你还想保留部分搜索引擎但阻止某些爬虫,可以保留 Googlebot、Bingbot、Baiduspider 的访问权限(它们默认会遵守规则)。
为了保险,在文件末尾加上:
User-agent: *
Allow: /
确保不会误封所有爬虫。
避坑指南:避免屏蔽有效爬虫与语法错误
操作中最容易犯的三个错误:
- 误判爬虫名称:不要凭印象写
Googlebot写成googlebot(大小写不敏感,但最好统一小写)。可以查看服务器日志中真实爬虫的User-agent全称。 - 忘记换行:每条规则之间必须有一个空行,否则会被视为同一个规则块。
- 屏蔽了正常搜索引擎:比如把
Baiduspider也加了Disallow: /,会导致百度无法收录。建议只针对明确不需要的爬虫进行屏蔽。 - 测试前未清除缓存:搜索引擎和浏览器会缓存 robots.txt,修改后需要等待一段时间才能生效。可以到 Google Search Console、Bing Webmaster Tools 或百度搜索资源平台里提交 robots.txt 测试。
效果验证:检查爬取日志与收录变化
修改并上传 robots.txt 后,按以下步骤验证:
- 本地测试:在浏览器打开
https://你的域名/robots.txt,确认内容正确。 - 使用在线工具:访问“Google robots.txt tester”或“Bing robots.txt tester”,模拟爬虫查看是否被阻止。
- 检查服务器访问日志:使用宝塔面板的“网站监控”或 SSH 运行
tail -f /var/log/nginx/access.log,看原来高频率出现的爬虫(如 Bytespider)是否不再出现。 - 观察收录变化:一周后对比搜索引擎的收录数量(site:你的域名)。如果收录开始回升,说明屏蔽有效。
常见问题解答
Q:修改 robots.txt 后需要重启服务器吗?
不需要。搜索引擎会在下次抓取时自动重新读取 robots.txt。
Q:屏蔽爬虫后网站速度会立刻变快吗?
不一定,但屏蔽大量并发爬虫后,服务器负载会明显降低,网页响应速度有改善。
Q:如果我不确定哪些爬虫是无用的,怎么办?
先查看网站日志,筛选出访问频率高但从未带来转化的爬虫,再逐一屏蔽。
总结
通过合理配置 robots.txt 屏蔽无用爬虫,是修复网站收录成本最低的手段之一。
关键步骤是:找到文件、写入正确规则、测试生效。
如果你遇到收录问题,建议先按本文操作,结合日志持续优化。
遇到异常时,优先检查语法和缓存,再确认是否误封了正常搜索引擎。