租用算力机器注意事项,合同与资源隔离风险
租用算力机器前,先搞清楚你要隔离什么
租用算力机器不只是选配置、比价格。
真正决定后续稳定性的,往往是合同里没写清楚的部分,以及资源隔离做得是否彻底。
如果你正准备租用 GPU 或高配 CPU 机器跑训练、渲染或推理任务,这篇文章会帮你从合同条款和隔离验证两个方向,把最容易踩的坑提前排掉。
签合同前,把这几项落到纸面
算力租用合同通常涉及资源规格、计费方式、SLA、数据责任和退出机制。
零基础用户最容易只看“多少钱一小时”,结果遇到超售、限速或退租纠纷。
资源规格要写“独享”还是“共享”
合同里必须明确 CPU、内存、GPU 型号、显存、硬盘类型和带宽是独享还是共享。
如果只写“8 核 16G”,实际可能是超售后的共享资源池。
建议要求服务商在合同附件中列出具体型号和数量,例如 NVIDIA A100 80GB × 1,而不是模糊的“高性能 GPU”。
计费与退订条款要逐条核对
重点看三处:计费周期是按秒、按小时还是按月;
停机是否继续计费;
提前退租是否扣除押金或剩余费用。
部分合同会写“不满一个月按一个月计费”,如果你只是短期测试,这条会直接拉高成本。
数据归属与删除义务
合同应写明:你上传的数据归你所有,服务商不得用于其他用途,退租后多少天内完成彻底删除。
如果合同只写“双方协商”,后续数据泄露时很难追责。
资源隔离风险:从系统层到网络层逐项验证
资源隔离不是服务商口头承诺,而是可以自己动手验证的。
租用后第一时间做下面几项检查,能发现大部分超售和串扰问题。
检查 CPU 与内存是否被限制
登录机器后执行:
lscpu | grep -E 'Model name|CPU\(s\)'
free -h
cat /sys/fs/cgroup/cpu.max 2>/dev/null
如果 lscpu 显示的核数远低于合同规格,或者 cpu.max 里出现明显的配额限制(例如 50000 100000 表示只能用 0.5 核),说明资源被 cgroup 限制。
此时可以跑一个短时压测:
stress-ng --cpu 8 --timeout 60s
观察 top 中 CPU 是否稳定在 800% 左右。
如果只能跑到 200%,隔离层已经把你的算力切走了。
验证 GPU 是否独享
GPU 机器要额外检查:
nvidia-smi
nvidia-smi -q | grep -i 'MIG\|vGPU'
如果输出中出现 MIG 或 vGPU 分区信息,说明 GPU 被切分给多个用户。
对于需要完整显存的训练任务,这种隔离方式可能导致显存不足或算力波动。
合同里应明确是否允许 MIG 切分。
网络隔离与带宽真实性
多租户环境下,内网可能被其他用户扫描。
建议检查防火墙规则:
sudo iptables -L -n
ss -tulnp
如果发现非自己开放的端口,立即关闭并联系服务商。
带宽方面,用 iperf3 对测速节点做双向测试,确认上下行是否达到合同承诺值。
避坑清单:这些情况别急着付款
- 合同只写“共享算力”但没有承诺最低保障值
- SLA 只写“99% 可用”却不说明故障赔偿方式
- 要求预付三个月以上费用,但退租条款模糊
- 机器交付后无法提供 root 或管理员权限
- 服务商拒绝提供资源隔离的验证方法
遇到以上任意一条,建议先小规模短租测试,不要一次性投入长期费用。
验证与留痕:租用后 24 小时内要做的事
完成上面检查后,把结果截图或保存为文本文件,包括 lscpu、free -h、nvidia-smi、带宽测试结果和防火墙规则。
这些记录在后续出现性能纠纷或数据安全问题时,是你最直接的证据。
如果服务商提供控制台,确认资源使用图表与实际压测结果是否一致。
不一致时,先通过工单书面沟通,保留聊天记录。
常见疑问
租用算力机器一定要签合同吗?
短期测试可以按平台协议走,但涉及长期训练或敏感数据时,建议签书面合同,明确资源规格、数据责任和退出机制。
资源隔离做得不好会有什么后果?
轻则算力被邻居抢占、任务变慢,重则内网被扫描、数据泄露。
GPU 场景下还可能因为显存被切分导致训练中断。
怎么判断服务商是否超售?
用压测工具跑满 CPU 或 GPU,对比实际性能和合同规格。
如果持续达不到承诺值,且服务商无法解释,基本可以判断存在超售。
租用算力机器时,把合同条款和资源隔离风险当成两个必查项,先验证再长期投入,能避开大部分隐性成本和安全问题。