本地部署大模型算力机器硬件选型指南
本地部署大模型,硬件选型的第一步不是看显卡价格,而是先算清你要跑的模型需要多少显存。
显存不够,再贵的机器也跑不起来;
显存够用但算力不足,推理速度会慢到无法接受。
这篇本地部署大模型算力机器硬件选型指南,会按“先估算需求、再匹配硬件、最后验证效果”的顺序,带你从零选出一台能真正跑起来的机器。
先算清楚:模型参数量与显存需求
大模型的显存占用主要来自三部分:模型权重、KV Cache(推理时缓存上下文用)和框架开销。
一个常用的估算方法是:
- FP16 精度:每 10 亿参数约需 2GB 显存。例如 7B 模型约 14GB,13B 约 26GB。
- INT8 量化:每 10 亿参数约需 1GB 显存,7B 约 7GB。
- INT4 量化:每 10 亿参数约需 0.5GB 显存,7B 约 3.5GB。
除了权重,还要给 KV Cache 留出空间。
上下文长度 4096、批处理大小为 1 时,7B 模型通常额外需要 1-2GB;
如果上下文拉到 32K,这部分会明显增大。
结论:先确定你要跑的模型和量化精度,再按“权重显存 × 1.2 + 2GB 余量”估算最低显存需求。 这一步决定了你买什么显卡,而不是反过来。
显卡怎么挑:显存优先,算力其次
本地部署大模型,显卡是整机里最不能省钱的部件。
挑选时按以下优先级判断:
- 单卡显存容量:优先选 24GB 及以上显存的卡,比如 RTX 3090、4090(24GB)。如果模型需要 48GB 以上,要么用两张卡做张量并行,要么考虑专业卡。
- 显存带宽:推理速度受显存带宽影响很大。带宽越高,token 生成越快。同价位下优先选带宽高的型号。
- FP16/BF16 算力:影响预填充和训练速度,纯推理场景可以适当放宽。
- 多卡互联:消费级卡没有 NVLink 时,多卡推理走 PCIe,效率会打折扣。如果计划多卡,主板和 CPU 的 PCIe 通道数要提前确认。
一句话判断:7B-13B 模型选 24GB 单卡即可;
30B-70B 建议 2 张 24GB 卡或一张 48GB 专业卡;
再大就考虑多机或租用算力。
配套硬件别拖后腿:CPU、内存、存储与电源
显卡选好后,其他部件要保证不成为瓶颈:
- CPU:不需要顶级,但至少 8 核 16 线程,支持足够多的 PCIe 通道。AMD 线程撕裂者或 Intel Xeon 系列适合多卡平台。
- 内存:建议不低于显存总和的 1.5 倍。例如双卡 48GB 显存,内存至少 64GB,推荐 128GB。模型加载和 CPU 卸载都吃内存。
- 存储:模型文件动辄几十 GB,建议 1TB 以上 NVMe SSD 做系统盘和模型盘。加载速度直接影响启动等待时间。
- 电源:按显卡 TDP 总和再加 30% 余量选。单张 4090 建议 850W 起,双卡建议 1200W 以上,并确认电源有足够的 12VHPWR 或 8pin 接口。
- 主板:多卡用户重点看 PCIe 插槽间距和通道拆分,避免显卡太厚插不下或降速。
整机配置示例与验证方法
以“本地跑 7B-13B 量化模型”为例,一套可落地的配置参考:
GPU:RTX 4090 24GB × 1
CPU:AMD Ryzen 9 7900X 或 Intel i7-13700K
内存:64GB DDR5
存储:2TB NVMe SSD
电源:1000W 金牌
主板:B650 或 Z790,确认 PCIe x16 插槽
装好系统后,用以下命令验证环境是否可用(以 Linux + NVIDIA 为例):
nvidia-smi
# 查看显卡型号、显存、驱动版本
python -c "import torch; print(torch.cuda.is_available())"
# 返回 True 表示 PyTorch 能调用 GPU
然后加载模型做一次推理测试,观察 nvidia-smi 中的显存占用和 GPU 利用率。
如果显存占用接近上限,说明余量不足,需要换更小的量化版本或升级显卡。
验证标准:模型能正常加载、推理不报 OOM(显存溢出)、生成速度在你可接受范围内,才算选型成功。
常见误区与避坑提醒
- 只看显卡不看显存:算力再高,显存不够直接跑不起来。
- 忽视电源和散热:高端显卡瞬时功耗高,电源不足会重启或掉卡。
- 内存按最低配买:模型加载阶段内存峰值很高,建议留足余量。
- 盲目追求多卡:没有 NVLink 时多卡推理效率提升有限,先确认框架是否支持。
- 忘记确认驱动和 CUDA 版本:不同框架对驱动版本有要求,建议以官方文档实际说明为准。
如果预算有限,可以先用云 GPU 按小时租用,验证模型效果后再决定是否购买整机。
硬件价格波动较大,具体型号和价格建议以电商或经销商实际报价为准。
几个常被问到的问题
跑 7B 模型最低需要什么显卡?
INT4 量化下 8GB 显存可以勉强运行,但上下文一长就容易 OOM。建议至少 12GB,24GB 会更从容。
能不能用 CPU 跑大模型?
可以,但速度很慢,只适合测试或极低并发场景。生产使用还是建议 GPU。
多张消费级显卡能替代专业卡吗?
推理可以,但训练和多卡通信效率不如专业卡。如果只是本地推理,双 24GB 消费卡是性价比较高的方案。
选型的核心逻辑始终是:先算显存需求,再匹配显卡,最后补齐配套硬件。
按这个顺序走,基本不会买错。