AI算力集群大规模宕机溯源,底层机柜供电架构缺陷分析
AI算力集群大规模宕机,很多时候不是GPU或调度软件先出问题,而是底层机柜供电架构存在单点缺陷。
本文面向零基础运维人员,讲清一次批量宕机后如何从机柜供电侧逐层溯源,包括PDU、双路冗余、UPS和母线槽的检查命令与判断标准,最终能定位到具体故障支路并验证恢复效果。
先分清供电链路,再谈溯源方向
AI集群机柜的供电链路通常从市电进入变压器,再经过低压配电柜、UPS、列头柜、PDU,最终到机柜内的服务器电源。
很多“集群宕机”实际是某一级支路跳闸或电压跌落,导致同列机柜批量掉电。
判断顺序建议从现象反推:如果整列机柜同时掉电,优先怀疑列头柜或母线槽插接箱;
如果单机柜异常,先查PDU和机柜内电源;
如果多列随机掉电,重点看UPS输出和上游配电。同一供电支路下的机柜,故障时间往往高度接近,这是溯源时最有效的线索。
前置准备:确认工具与安全边界
现场操作前,先在带外管理或监控平台确认宕机范围,不要直接断电重启。
- 确认受影响机柜编号、所在列、对应列头柜或母线槽插接箱编号。
- 准备钳形电流表、红外测温仪、笔记本和串口线。
- 登录监控系统查看历史曲线,例如Zabbix或Prometheus中PDU电流、电压、功率的突变点。
- 记录宕机发生时间,精确到分钟,方便和配电柜告警日志对齐。
如果现场有智能PDU,可先读取支路数据:
# 以SNMP读取智能PDU电流为例
snmpwalk -v2c -c public 192.168.10.21 1.3.6.1.4.1.318.1.1.12.2.3.1.1.4
输出中若某支路电流接近或超过额定值,说明该支路存在过载风险,需要结合机柜实际负载复核。
逐级排查:从PDU查到上游配电
1. 检查机柜PDU与电源模块
先看机柜内PDU指示灯和断路器状态。
若PDU断路器跳闸,不要立刻合闸,先测量负载电流。
# 通过IPMI查看服务器电源状态和功耗
ipmitool -I lanplus -H 10.0.0.31 -U admin -P 密码 power status
ipmitool -I lanplus -H 10.0.0.31 -U admin -P 密码 sensor | grep -i pwr
如果同一机柜A、B两路PDU中只有一路有电,而服务器没有配置双电源冗余,掉电就是必然结果。AI服务器整机功耗高,单路供电一旦中断,业务会直接掉线。
2. 核对双路冗余是否真正独立
很多机柜标称双路供电,但A、B路最终来自同一台UPS或同一段母线,这属于假冗余。
排查时沿桥架查线,确认两路PDU分别接到不同的列头柜或不同UPS输出。
可查看列头柜标签和配电图,核对:
- A路PDU接列头柜A,B路PDU接列头柜B。
- 两路UPS输出相互独立,且不在同一检修段。
- 母线槽插接箱没有把双路并接到同一相。
双路冗余失效是机柜供电架构里最常见的隐性缺陷,平时不发作,一旦上游单路故障就会批量宕机。
3. 检查UPS与母线槽告警
登录UPS管理卡或动环监控,查看是否出现旁路、过载、电池供电等记录。
# 以APC UPS网络管理卡为例,查看事件日志
snmpwalk -v2c -c public 192.168.10.50 1.3.6.1.4.1.318.1.1.1.11
若日志显示UPS曾切换到旁路或瞬时过载,说明上游供电存在扰动。
此时要结合母线槽测温数据,检查插接箱接触是否松动、接头是否过热。
避坑指南:溯源时容易做错的几件事
- 不要只重启服务器,不查供电支路,问题会反复出现。
- 不要用单路PDU带双电源服务器就认为有冗余,必须确认两路来源独立。
- 不要在未测量电流的情况下直接合闸跳闸的PDU断路器。
- 不要忽略机柜内电源线径和插座额定值,AI服务器满载时电流可能超过普通插座承载能力。
- 不要只看告警平台,动环和配电柜本地日志往往更早记录异常。
效果验证:确认缺陷已消除
完成整改后,按以下方式验证:
- 在监控平台观察对应列头柜和PDU电流曲线,确认三相不平衡度在合理范围。
- 模拟单路UPS检修,验证双路PDU下服务器仍能正常运行。
- 用红外测温仪复测母线槽插接箱和PDU接线端子,温度应明显低于整改前。
- 查看带外管理日志,确认没有再次出现批量掉电记录。
如果验证期间再次出现同一支路告警,说明缺陷没有真正定位,需要回到配电图和线缆走向继续核对。
常见疑问
没有智能PDU,还能做供电溯源吗?
可以。用钳形电流表在列头柜和PDU进线处逐路测量,配合宕机时间点比对,同样能缩小范围。
双路供电的服务器为什么还会掉电?
如果两路实际来自同一上游,或服务器电源模块故障、电源线松脱,双路也会失效。要同时检查电源模块状态和线缆连接。
机柜供电架构整改后需要复测多久?
建议至少覆盖一个完整业务高峰周期,观察电流、温度和告警记录,确认没有新的异常突变。
AI算力集群大规模宕机溯源,核心是把供电链路拆成可验证的层级,而不是停留在重启和换硬件。
先确认故障支路,再核对双路冗余是否独立,最后用监控曲线和测温结果验证,才能把机柜供电架构缺陷真正闭环。