液冷机柜普及加速,智算中心PUE如何压到1.1以内
液冷机柜普及后,智算中心要把PUE压到1.1以内,核心不是单纯换更冷的空调,而是把散热路径从房间级转移到芯片级,同时让冷源温度尽量接近室外自然冷源。
PUE等于总能耗除以IT设备能耗,液冷能砍掉大部分风机和压缩机功耗,但前提是冷源、CDU二次侧和风液协同参数匹配。
下面按零基础运维能直接执行的顺序展开。
先看冷源和二次侧温度能不能对上
液冷机柜的散热效率取决于供液温度与芯片允许结温之间的余量。
冷板液冷常见设计是二次侧供液温度在30~45℃区间,具体以服务器厂商和CDU手册为准。
冷源侧如果还用7℃冷冻水,就白白浪费了自然冷却机会。
执行检查时,登录CDU管理界面或通过Modbus读取以下参数:
# 以Linux采集为例,通过modbus poll读取CDU二次侧供回液温度
modbus poll --device /dev/ttyS0 --baud 9600 --parity N --stopbits 1 \
--slave 1 --function 3 --address 0 --count 2
重点看二次侧供液温度是否稳定在设定值±1℃内,供回液温差是否在5~10℃。
如果供液温度低于25℃,先确认是不是冷源侧阀门开度或板换换热面积不够,而不是继续调低冷机出水温度。
把CDU二次侧流量和压差调到设计区间
流量不足会导致芯片局部热点,流量过大又增加泵功耗。
每台CDU的额定流量和机柜支路压差在铭牌和调试报告里都有。
现场按以下顺序核对:
- 在CDU触摸屏进入“运行参数”页,记录当前二次侧流量和泵频率。
- 对比设计流量,偏差超过10%时检查快接头是否插到位、软管是否折弯。
- 观察机柜分水器压差,冷板支路压差一般要求在20~50kPa,具体以服务器厂商要求为准。
- 若压差偏低,先排气再补液,不要直接提高泵频。
二次侧流量和压差是液冷机柜能否稳定带走热量的硬指标,参数不对时PUE再低也没有意义。
风液协同别让房间空调拖后腿
液冷机柜普及后,机房内仍有电源、交换机、硬盘等风冷部件。
如果房间空调还按传统22℃送风,冷源能耗降不下来。
合理做法是把机房温度提高到27~32℃区间,同时保证机柜进风温度不超过设备允许上限。
操作上先关闭或调小未部署液冷区域的空调,再在冷通道布置温度传感器。
通过DCIM或动环系统查看冷通道温度分布,若局部超过32℃,优先调整送风口方向或增加盲板,而不是降低空调设定值。
这样风冷部分功耗下降,整体PUE才有机会靠近1.1。
常见报错和容易踩的坑
液冷系统调试时,下面几个问题出现频率最高:
- CDU报“二次侧流量低”:先查快接头是否漏插、过滤器是否堵塞,再查泵是否气蚀。
- 机柜分水器压差报警:多数是支路阀门未全开或软管折弯,不要急着改泵频。
- 供液温度波动大:检查冷源侧板换是否结垢、三通阀响应是否正常。
- PUE计算偏高:确认IT负载是否稳定,低负载时PUE天然偏高,建议在负载率60%以上再评估。
避坑重点是:不要为了追求低PUE而牺牲芯片结温安全,任何参数调整都要以服务器厂商白皮书和CDU手册为准。
验证是否压到1.1以内的实操方法
参数调完后,用不少于72小时的连续数据来验证。
在DCIM或电表系统导出总输入功率和IT设备功率,按小时计算PUE。
# 示例:从两个电表读数计算小时PUE
total_kwh=1250
it_kwh=1080
pue=$(echo "scale=3; $total_kwh / $it_kwh" | bc)
echo "当前PUE: $pue"
若结果在1.1附近,再检查冷源侧是否已切换到自然冷却模式。
如果仍是压缩机制冷,PUE很难稳定低于1.15。
最终数值以现场电表和控制台实际显示为准,不同负载率下会有波动。
几个常被问到的问题
液冷机柜一定要配CDU吗?冷板液冷通常需要CDU做二次侧循环和换热,具体选型看机柜功率密度和厂商方案。
PUE压到1.1以内是不是必须全液冷?不一定,风液混合也能做到,但风冷部分占比越高,难度越大。
自然冷却能用多久?取决于当地气象条件,建议查全年湿球温度分布,以实际运行数据为准。
如果你的智算中心正在推进液冷机柜改造,建议先把冷源温度和二次侧流量调稳,再逐步提高机房温度,最后用连续电表数据验证PUE。
遇到异常时优先回看CDU流量和压差,不要盲目调低冷机出水温度。