微调模型推理接入中转网关对外提供标准OpenAI接口

微调完成的模型不能直接给业务方使用,通常需要先部署成推理服务,再通过中转网关把 OpenAI 格式的请求转发给后端。
这样做的好处是:业务方只需要一个统一的 Base URL 和 API Key,就能调用多个模型,同时还能做限流、审计和负载分发。
本文以 vLLM 作为推理服务、one-api 作为网关为例,带你从零完成配置。

先把推理服务和网关准备好

动手之前,请确认以下条件已经满足:

  • 微调好的模型已经能正常加载,建议使用 vLLM 或其他支持 OpenAI 兼容接口的推理框架。
  • 已经部署了一个中转网关,比如 one-api 或 new-api,并且能登录管理后台。
  • 具备服务器命令行操作权限,至少能执行 curl 命令。

后续步骤中,假设推理服务监听在 127.0.0.1:8000,网关已经通过 80 端口对外提供访问。
实际 IP 和端口请按你的服务器环境调整。

让推理服务暴露 OpenAI 兼容端点

以 vLLM 为例,启动一个微调模型的 OpenAI 兼容服务:

python -m vllm.entrypoints.openai.api_server \
  --model /data/models/your-model \
  --served-model-name your-model \
  --host 0.0.0.0 \
  --port 8000

启动后,在服务器本地验证一下接口是否可用:

curl http://127.0.0.1:8000/v1/models

如果返回模型列表,说明推理服务已经具备 OpenAI 兼容接口。网关本身不负责模型计算,它只负责把 OpenAI 格式的请求转发给后端推理服务。 因此这一步是整个链路的基础。

在网关中添加渠道和令牌

登录 one-api 管理后台,进入「渠道」->「添加渠道」。

  • 类型选择 OpenAI
  • 密钥填推理服务的 API Key。如果 vLLM 没启用鉴权,可以填一个占位符,比如 sk-no-auth
  • 代理地址填 http://127.0.0.1:8000
  • 模型列表填 your-model
  • 状态选启用,然后保存。

接着进入「令牌」->「添加令牌」,创建一个新令牌,并在授权模型中选择刚才填写的 your-model
保存后,业务方拿到的信息是:

  • Base URL:http://你的服务器IP:端口
  • API Key:sk-xxxxxxxx
  • 模型名:your-model

网关填写的模型名必须与推理服务的 --served-model-name 完全一致,否则会出现模型不存在或 404 错误。

最容易踩的几个坑

  • 容器网络地址写错:网关和后端如果都跑在 Docker 里,127.0.0.1 指向的是容器自身,不是宿主机。此时应写 host.docker.internal 或宿主机内网 IP。
  • 防火墙拦着端口:无论是网关端口还是后端推理端口,都需要在云控制台和系统防火墙中放行。否则请求会一直卡住或提示连接超时。
  • 密钥格式不合法:有些网关版本要求密钥不能为空,且必须以 sk- 开头。未启用鉴权时,可以填 sk-no-auth 这类占位符。
  • 模型名写错:网关渠道里的模型列表、令牌授权的模型、请求体里的 model 字段,三者必须保持一致。

从业务方角度验证整个链路

配置完成后,用一条 curl 命令模拟业务方调用:

curl http://你的服务器IP/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-你的令牌" \
  -d '{"model": "your-model", "messages": [{"role": "user", "content": "你好"}]}'

如果返回包含 choices 字段的 JSON,说明从网关到推理服务的整条链路已经打通。
也可以把这个地址填到支持自定义 Base URL 的聊天客户端里,进一步确认模型回复是否正常。

如果你正在处理微调模型推理接入中转网关的问题,建议先按本文步骤完整执行,再根据自己的环境微调;
遇到异常时优先回看上面的避坑说明。
不同网关版本的菜单位置可能略有差异,以你实际部署的界面为准。

分享到:
上一篇
Agent网络访问控制,白名单域名
下一篇
Embedding批量处理,大量文档向量化任务多进程加速脚本
1
系统公告

机房迁移升级通知

尊敬的用户: IP 段 103.23.148.x、156.224.29.x 原香港一区线路波动、攻击频繁,平台定于 7 月 5 日凌晨分批迁移至香港 GIA 机房,硬件升级 AMD 铂金机型。 迁移均在凌晨操作,最大程度降低业务影响,迁移期间服务器临时关机; 升级后配置不降低、费用不涨价,数据默认同步迁移; 迁移后 IP 全部更换,请及时修改域名解析、防火墙白名单; 建议提前备份重要数据,有问题可联系在线客服。 感谢理解与支持! 泽御云科技 2026.06.30
服务中心
客服
在线客服
24小时为您服务
咨询
联系我们
联系我们,为您的业务提供专属服务。
24/7 技术支持
如果您遇到寻求进一步的帮助,请过工单与我们进行联系。
24/7 即时支持
泽御云
售前客服
泽御云
泽御云
售后客服
泽御云
技术支持
评价
您对当前页面的整体感受是否满意?
😞
非常不满意
😕
不满意
😐
一般
🙂
满意
😊
非常满意