网站爬虫UA识别,区分搜索引擎与恶意爬虫
网站爬虫UA识别,简单说就是通过HTTP请求头里的User-Agent字段,判断访问者到底是搜索引擎的合法爬虫,还是伪装成浏览器的恶意爬虫。
本文面向零基础站长,给出可直接落地的Nginx配置片段、日志分析命令和验证方法,帮你把正常收录和恶意抓取区分开,减少服务器资源浪费。
先搞清楚UA字段能做什么、不能做什么
User-Agent是客户端在HTTP请求头里主动声明自己身份的一串文本。
搜索引擎爬虫通常会带上可识别的标识,比如百度蜘蛛常见包含Baiduspider,Google爬虫常见包含Googlebot。
恶意爬虫也可以随意伪造这些字符串,所以UA识别只能做第一层筛选,不能单独作为最终判断依据。
判断逻辑可以按这个优先级来:
- 先看UA是否匹配已知搜索引擎爬虫特征;
- 再核对请求来源IP是否属于该搜索引擎公布的IP段;
- 最后结合访问频率、请求路径和是否遵守robots.txt综合判断。
如果只靠UA放行或封禁,误伤和漏放的概率都不低。
准备条件
开始操作前,你需要确认几件事:
- 服务器已安装Nginx,并且你能修改站点配置文件,路径通常在
/etc/nginx/conf.d/或/www/server/panel/vhost/nginx/; - 有SSH登录权限,能执行
tail、grep、awk等基础命令; - 知道网站访问日志的位置,宝塔面板默认在
/www/wwwlogs/,原生Nginx常见在/var/log/nginx/; - 如果使用CDN,先确认日志里拿到的是真实客户端IP,否则后续IP核对会失效。
从访问日志里找出可疑UA
先不要急着改配置,用日志摸清现状更稳妥。
假设你的访问日志是access.log,执行下面几条命令可以快速定位异常:
# 统计出现次数最多的20个User-Agent
awk -F'"' '{print $6}' access.log | sort | uniq -c | sort -rn | head -20
# 筛选包含常见搜索引擎标识的请求
grep -Ei 'Baiduspider|Googlebot|bingbot|Sogou|360Spider' access.log | head -20
# 找出请求频率异常高的IP
awk '{print $1}' access.log | sort | uniq -c | sort -rn | head -20
如果某个UA字符串很短、包含大量随机字符,或者同一个IP在短时间内请求了成百上千次动态页面,这类流量通常值得重点排查。
在Nginx里配置UA识别规则
Nginx可以通过map指令把UA映射成变量,再配合if或limit_req做处理。
下面是一个可参考的配置片段,放在http块或站点配置的server块外层:
map $http_user_agent $is_bad_bot {
default 0;
~*(Scrapy|Python-urllib|Java|curl|wget|HTTrack|MJ12bot|SemrushBot) 1;
}
map $http_user_agent $is_good_bot {
default 0;
~*(Baiduspider|Googlebot|bingbot|Sogou|360Spider) 1;
}
然后在server块里做返回处理:
server {
listen 80;
server_name example.com;
if ($is_bad_bot) {
return 403;
}
location / {
# 正常业务配置
}
}
改完后执行nginx -t检查语法,再nginx -s reload重载。
注意这里的匹配规则只是示例,实际使用时建议根据自己的日志逐步补充,不要一次性封禁过多UA,以免误伤正常工具或合作方。
避坑指南:UA识别最容易踩的几个坑
- 只信UA字符串:恶意爬虫可以伪造
Baiduspider,所以封禁或放行前最好结合IP段核实。搜索引擎官方通常会公布爬虫IP列表,可以定期比对。 - 正则写得太宽:比如只写
bot,会把很多正常浏览器或插件也拦掉。建议使用明确的爬虫名称,并加上边界条件。 - 忽略CDN和反向代理:如果网站前面有CDN,Nginx日志里记录的可能是CDN节点IP,此时需要配置
real_ip模块才能拿到真实客户端IP。 - 直接封禁整个IP段:有些搜索引擎和普通用户可能共用出口IP,粗暴封段容易误伤,优先按UA加频率限制处理。
- 忘记观察误杀:上线规则后至少观察一天,确认没有把正常收录或用户访问拦掉。
验证配置是否生效
配置完成后,用下面几种方式验证:
- 用
curl模拟不同UA访问,观察返回状态码:
curl -A "Scrapy/2.11" -I http://example.com
curl -A "Baiduspider" -I http://example.com
如果配置正确,第一个请求应返回403,第二个应返回200。
- 查看Nginx错误日志,确认被拦截的请求有记录:
tail -f /var/log/nginx/error.log
- 观察搜索引擎后台的抓取统计,如果收录量没有明显下降,说明规则没有误伤正常爬虫。
UA识别只是爬虫管理的第一步。
真正稳定的做法是UA、IP、访问频率和robots.txt多维度配合。
如果你正在处理网站爬虫UA识别,建议先按本文命令摸清日志现状,再小范围加规则并持续观察,遇到异常优先回看避坑部分。