返回列表
单柜功耗从10kW飙到50kW以上,传统风冷上限只有20kW——选错散热方案,AI服务器轻则降频、重则宕机。这篇文章帮你一次理清思路。
先看一组数字:一台8卡AI训练服务器,整机重量60-80公斤,满载功耗动辄4.8kW以上。而一台传统服务器只有15-25公斤。
功耗大了,热量自然成倍增加。
AI服务器面临的散热挑战,主要体现在三个层面:
选机箱散热,本质上是在选一个能把这几千瓦热量持续、稳定排出去的系统。
AI服务器散热主要有三条路线:风冷、液冷(冷板式)、液冷(浸没式)。
| 对比维度 | 传统风冷 | 冷板式液冷 | 浸没式液冷 |
|---|---|---|---|
| 单柜散热上限 | ~20kW | 50-200kW | 160kW以上 |
| PUE(能效比) | 1.5-1.8 | 1.15-1.2 | <1.13 |
| 改造成本 | 低 | 中等 | 高(需重构机房) |
| 维护难度 | 简单 | 中等 | 复杂,需专业人员 |
| 适用场景 | 单柜<10kW | 10-50kW,主流选择 | 超大规模集群 |
具体怎么选?记住这条分界线:10kW是液冷成本优势的分水岭。低于10kW,风冷更经济;超过10kW,液冷的TCO开始占优;超过30kW,液冷几乎是唯一选择。
确定了散热路线,具体挑机箱时看这4个点:
AI服务器通常需要大板。至少要能装下E-ATX,最好支持SSI-EEB(比E-ATX还大一圈的服务器专用主板规格,用于双路甚至四路CPU)。
机架式服务器常见高度:1U/2U密度高但散热空间小,4U适合多GPU系统,6U/7U/8U则给风冷和风道留出更多余地。例如,一些6U机架式设计可容纳8张标准全高GPU。
风冷机箱的核心就是风道。
好的设计会考虑:前进后出的直线风道、GPU区域的定向风流、热区多点温控监测。风扇方面,140mm直径风扇在相同转速下风量比120mm提升30%,噪音还更低。
市面上一些全塔工作站支持最多15把风扇,顶部和前面板都能装480mm超大冷排;也有型号能容纳多达30个12cm风扇——这些数字背后反映的是同一个逻辑:风冷拼的就是风量和风道效率。
多卡AI服务器动辄4卡、8卡,PCIe插槽数量至少要8个以上。同时要关注显卡长度限制——多数机箱标称支持340mm-390mm显卡。
另外,显卡支架是刚需。几公斤重的专业显卡悬在主板上,没有支架支撑,长期震动可能导致PCIe插槽损坏。
AI服务器功耗大,双电源位几乎是标配。部分机箱还支持冗余电源模块,保证训练任务不中断。
以下列举几类常见产品设计方向,供您对照自身需求:
第一步:算功耗。 统计你计划安装的所有GPU、CPU的TDP,估算整机满载功耗。
第二步:定路线。 功耗<10kW走风冷,10-50kW考虑冷板式液冷,>50kW基本只能上液冷甚至浸没式。
第三步:挑机箱。 根据选定的散热路线,对照主板尺寸、风扇位/冷排位、GPU插槽数量、显卡长度限制四个指标筛选产品。
AI算力爆发还在继续,当前单机柜平均功率预计达到19.4kW,30kW以上占比将达29%。散热不是选配,是标配——选错了,再贵的GPU也跑不出应有的性能。