自建AI中转并发限流防止GPU满载宕机实操指南

为什么要给AI中转做并发限流

当你自建了AI模型(例如通过vLLM部署的Llama或Qwen),并用Nginx或类似工具做反向代理暴露API时,一旦外部请求并发量超过GPU的推理极限,显存会迅速耗尽,导致OOM(Out Of Memory)甚至整机宕机。并发限流就是在上层拦截多余的请求,保证GPU始终在安全水位运行。
本文以Nginx的limit_req模块为例,示范一个零基础也能照做的方案。

准备环境与查看GPU状态

首先登录服务器,确认你已经安装了Nginx和nvidia-smi工具。
执行以下命令查看当前GPU使用率:

nvidia-smi --query-gpu=utilization.gpu,memory.used --format=csv -l 1

记录下空闲时的显存占用和利用率。
假设你的模型在单卡上最大处理能力是10并发(这个值需要根据实际压测得出),我们就以此为阈值。

安装Nginx(如果还未安装):

sudo apt update && sudo apt install nginx -y   # Debian/Ubuntu

通过Nginx配置并发限流

编辑Nginx配置文件(通常在/etc/nginx/nginx.conf/etc/nginx/sites-available/default)。
我们使用limit_req_zone定义共享内存区域,然后在location中引用。

示例配置:

http {
    # 定义一个名为limit_by_ip的共享内存区,大小10MB,限制平均每秒最多5个请求
    limit_req_zone $binary_remote_addr zone=limit_by_ip:10m rate=5r/s;

    server {
        listen 80;
        server_name your-domain.com;

        location /v1/chat/completions {
            # 参考burst允许瞬时峰值,但不延迟排队
            limit_req zone=limit_by_ip burst=10 nodelay;
            proxy_pass http://127.0.0.1:8000; # 你的AI API后端地址
            proxy_set_header Host $host;
            proxy_set_header X-Real-IP $remote_addr;
        }
    }
}

参数解释

  • rate=5r/s:每个客户端IP平均每秒最多5个请求。
  • burst=10:允许瞬时超过速率限制的请求数最多10个(这些请求会排队等待)。
  • nodelay:排队时不延迟处理,直接放行但超出burst后立刻拒绝。

你需要根据自己的GPU能力调整rateburst
开始时可以设置保守值(如rate=2r/sburst=5),再通过压测逐步提升。

保存配置后重载Nginx:

sudo nginx -t   # 检查语法
sudo systemctl reload nginx

参数调优与避坑说明

  • 不要设置过大的burst:burst过大相当于限流效果被削弱,GPU仍可能满载。建议burst不超过rate值的2倍。
  • 区分客户端还是总量:上述配置按IP限流,如果你想让所有请求共享一个总限流,可以将$binary_remote_addr改成$server_name或使用limit_req_zone $http_x_forwarded_for(需配合real_ip模块)。
  • 日志观察:被限流的请求会返回503 Service Unavailable,在Nginx错误日志中可以看到limiting requests的条目。开启错误日志:
  error_log /var/log/nginx/error.log warn;
  • 白名单:如果某些内部服务需要高并发,可以用geo模块设置白名单跳过限流。

压测验证效果

使用abwrk模拟并发请求,同时观察GPU状态。

安装absudo apt install apache2-utils),然后运行:

ab -n 100 -c 20 http://your-domain.com/v1/chat/completions

参数-c 20表示20个并发。
正常情况下,超过rate + burst(例如5+10=15)的请求会被拒绝,返回503。
此时用nvidia-smi查看GPU利用率,应该不会达到100%。
如果GPU仍满载,说明限流值设置过高,需要降低rateburst

另外可以查看Nginx状态码统计:

sudo tail -f /var/log/nginx/access.log | awk '{print $9}'

如果大量出现503,说明限流生效。

常见问题解答

Q:限流导致正常用户也返回503怎么办?
A:先检查rateburst是否过小。增大burst可以容忍突发,但不要超过GPU处理能力。也可以使用limit_req_status自定义返回码,例如改为429(Too Many Requests)更语义化。

Q:为什么我设置了限流,GPU还是满载?
A:可能原因:1)限流基于IP,但攻击者使用了大量IP;2)你的后端没有正确限制单个请求的资源消耗(比如提示词过长)。建议配合proxy_read_timeout和客户端超时设置。更严格的做法是:在Nginx层对每个请求的body大小做限制。

Q:我的中转服务是one-api或Lobe Chat,怎么集成限流?
A:这些工具本身带有速率限制功能,可以优先在应用层配置。如果仍需Nginx双重保护,参考本文的配置同样适用。

如果你正在处理自建AI中转并发限流防止GPU满载宕机,建议先按本文步骤完整执行,再根据自己的环境做微调;
遇到异常时优先回看避坑和高频问题部分。

分享到:
上一篇
多租户OneAPI权限分离杜绝数据互通泄露
下一篇
Ollama离线模型包无网络住宅主机部署
1
系统公告

机房迁移升级通知

尊敬的用户: IP 段 103.23.148.x、156.224.29.x 原香港一区线路波动、攻击频繁,平台定于 7 月 5 日凌晨分批迁移至香港 GIA 机房,硬件升级 AMD 铂金机型。 迁移均在凌晨操作,最大程度降低业务影响,迁移期间服务器临时关机; 升级后配置不降低、费用不涨价,数据默认同步迁移; 迁移后 IP 全部更换,请及时修改域名解析、防火墙白名单; 建议提前备份重要数据,有问题可联系在线客服。 感谢理解与支持! 泽御云科技 2026.06.30
服务中心
客服
在线客服
24小时为您服务
咨询
联系我们
联系我们,为您的业务提供专属服务。
24/7 技术支持
如果您遇到寻求进一步的帮助,请过工单与我们进行联系。
24/7 即时支持
泽御云
售前客服
泽御云
泽御云
售后客服
泽御云
技术支持
评价
您对当前页面的整体感受是否满意?
😞
非常不满意
😕
不满意
😐
一般
🙂
满意
😊
非常满意