网站爬虫UA识别,区分搜索引擎与恶意爬虫

网站爬虫UA识别,简单说就是通过HTTP请求头里的User-Agent字段,判断访问者到底是搜索引擎的合法爬虫,还是伪装成浏览器的恶意爬虫。
本文面向零基础站长,给出可直接落地的Nginx配置片段、日志分析命令和验证方法,帮你把正常收录和恶意抓取区分开,减少服务器资源浪费。

先搞清楚UA字段能做什么、不能做什么

User-Agent是客户端在HTTP请求头里主动声明自己身份的一串文本。
搜索引擎爬虫通常会带上可识别的标识,比如百度蜘蛛常见包含Baiduspider,Google爬虫常见包含Googlebot。
恶意爬虫也可以随意伪造这些字符串,所以UA识别只能做第一层筛选,不能单独作为最终判断依据。

判断逻辑可以按这个优先级来:

  • 先看UA是否匹配已知搜索引擎爬虫特征;
  • 再核对请求来源IP是否属于该搜索引擎公布的IP段;
  • 最后结合访问频率、请求路径和是否遵守robots.txt综合判断。

如果只靠UA放行或封禁,误伤和漏放的概率都不低。

准备条件

开始操作前,你需要确认几件事:

  • 服务器已安装Nginx,并且你能修改站点配置文件,路径通常在/etc/nginx/conf.d/或/www/server/panel/vhost/nginx/;
  • 有SSH登录权限,能执行tail、grep、awk等基础命令;
  • 知道网站访问日志的位置,宝塔面板默认在/www/wwwlogs/,原生Nginx常见在/var/log/nginx/;
  • 如果使用CDN,先确认日志里拿到的是真实客户端IP,否则后续IP核对会失效。

从访问日志里找出可疑UA

先不要急着改配置,用日志摸清现状更稳妥。
假设你的访问日志是access.log,执行下面几条命令可以快速定位异常:

# 统计出现次数最多的20个User-Agent
awk -F'"' '{print $6}' access.log | sort | uniq -c | sort -rn | head -20
# 筛选包含常见搜索引擎标识的请求
grep -Ei 'Baiduspider|Googlebot|bingbot|Sogou|360Spider' access.log | head -20
# 找出请求频率异常高的IP
awk '{print $1}' access.log | sort | uniq -c | sort -rn | head -20

如果某个UA字符串很短、包含大量随机字符,或者同一个IP在短时间内请求了成百上千次动态页面,这类流量通常值得重点排查。

在Nginx里配置UA识别规则

Nginx可以通过map指令把UA映射成变量,再配合if或limit_req做处理。
下面是一个可参考的配置片段,放在http块或站点配置的server块外层:

map $http_user_agent $is_bad_bot {
    default 0;
    ~*(Scrapy|Python-urllib|Java|curl|wget|HTTrack|MJ12bot|SemrushBot) 1;
}

map $http_user_agent $is_good_bot {
    default 0;
    ~*(Baiduspider|Googlebot|bingbot|Sogou|360Spider) 1;
}

然后在server块里做返回处理:

server {
    listen 80;
    server_name example.com;

    if ($is_bad_bot) {
        return 403;
    }

    location / {
        # 正常业务配置
    }
}

改完后执行nginx -t检查语法,再nginx -s reload重载。
注意这里的匹配规则只是示例,实际使用时建议根据自己的日志逐步补充,不要一次性封禁过多UA,以免误伤正常工具或合作方。

避坑指南:UA识别最容易踩的几个坑

  • 只信UA字符串:恶意爬虫可以伪造Baiduspider,所以封禁或放行前最好结合IP段核实。搜索引擎官方通常会公布爬虫IP列表,可以定期比对。
  • 正则写得太宽:比如只写bot,会把很多正常浏览器或插件也拦掉。建议使用明确的爬虫名称,并加上边界条件。
  • 忽略CDN和反向代理:如果网站前面有CDN,Nginx日志里记录的可能是CDN节点IP,此时需要配置real_ip模块才能拿到真实客户端IP。
  • 直接封禁整个IP段:有些搜索引擎和普通用户可能共用出口IP,粗暴封段容易误伤,优先按UA加频率限制处理。
  • 忘记观察误杀:上线规则后至少观察一天,确认没有把正常收录或用户访问拦掉。

验证配置是否生效

配置完成后,用下面几种方式验证:

  • 用curl模拟不同UA访问,观察返回状态码:
curl -A "Scrapy/2.11" -I http://example.com
curl -A "Baiduspider" -I http://example.com

如果配置正确,第一个请求应返回403,第二个应返回200。

  • 查看Nginx错误日志,确认被拦截的请求有记录:
tail -f /var/log/nginx/error.log
  • 观察搜索引擎后台的抓取统计,如果收录量没有明显下降,说明规则没有误伤正常爬虫。

UA识别只是爬虫管理的第一步。
真正稳定的做法是UA、IP、访问频率和robots.txt多维度配合。
如果你正在处理网站爬虫UA识别,建议先按本文命令摸清日志现状,再小范围加规则并持续观察,遇到异常优先回看避坑部分。

分享到:
上一篇
网站密码加盐存储,CMS用户密码安全方案
下一篇
网站301和302重定向区别,SEO影响对比
1
系统公告

泽御云中秋国庆双节活动上线:新购8折,拼团3.99元起

尊敬的用户:
泽御云“月满中秋·礼贺国庆”双节活动现已开启,活动时间为2026年9月23日至10月10日。 活动期间可享以下福利:
1. 常规云服务器新购使用优惠码“泽御中秋国庆同乐”,符合条件的订单享8折优惠。
2. 香港精品云服务器5人拼团低至3.99元,部分4核4G套餐3人拼团年付388元,续费同价。
3. 新用户购买年付云服务器,符合活动规则可赠送2个月使用时长。
4. 老用户续费季度赠15天,续费年度赠2个月;活动期间升级配置免收配置迁移手续费。
5. 推荐好友成功下单,符合条件的推荐人可获赠7天服务器使用时长。
6. 活动期间享宕机补偿标准翻倍、简单网站迁移协助及技术工单优先处理权益。
温馨提示:优惠码不适用于拼团套餐、活动轻量产品、年付订单及续费订单;拼团套餐为独立特价活动,不与赠时类福利叠加。赠送时长不可折现、退款或跨账户转移,具体规则以活动页面说明为准。
服务中心
客服
在线客服
24小时为您服务
咨询
联系我们
联系我们,为您的业务提供专属服务。
24/7 技术支持
如果您遇到寻求进一步的帮助,请过工单与我们进行联系。
24/7 即时支持
泽御云
售前客服
泽御云
泽御云
售后客服
泽御云
技术支持
评价
您对当前页面的整体感受是否满意?
😞
非常不满意
😕
不满意
😐
一般
🙂
满意
😊
非常满意