技术指南
制约下一代集群的不是 GPU,而是电力
多数集群方案以 GPU 数量为起点进行规划,随后才发现机房无法满足供电需求。从供电条件反向推导,才能得到真正可运行的设计。
关于新建训练集群的讨论,几乎总是从 GPU 数量开始。有人提出「64 张 B300」,话题随即转向网络拓扑与存储吞吐。而真正决定整个方案能否落地的数字,也就是机房实际能够提供的千瓦数,往往要到讨论接近尾声、设施管理人员终于参与进来时才被提及。
被跳过的那道算术题
一台八卡 B300 节点在持续负载下功耗约为 14kW。八台即为 112kW,这还未计入任何交换机、PDU 与存储设备。而常规企业机柜的供电配置通常在 7kW 至 15kW 之间。即便是规格良好的 30kW 托管机柜,也仅能容纳两台节点。
因此,64 张 GPU 意味着 8 台节点,约 120kW,根据场地条件需要 4 至 16 个机柜,而非最初讨论中设想的单个机柜。GPU 数量从来都不是真正的难点。
风冷在机柜装满之前就已失效
散热的失效早于供电。当单机柜功率超过约 40kW 时,无论供电是否充足,风冷都已不再可行:所需风量超出机柜可通过的上限,且机柜内的温升会使后端设备的进风温度超出规格范围。
这正是液冷方案在此类设计中会在特定功率密度下成为必选项、而非高端选配的原因。此时的考量已不在于能效,而在于硬件能否以额定频率正常运行。
改为反向推导
从场地条件出发。先确认单机柜可用功率、散热能力,以及楼板承重规格。这三个数字决定了单机柜可容纳的节点数量,节点数量再决定 GPU 数量。得出的结论往往小于项目最初设想的规模,这个结果并不令人愉快,但远比在采购订单签署之后才发现要划算得多。
当业务负载确实需要超出场地条件的密度时,液冷方案可以抬高上限。一台 300kW 行间 CDU 能够支撑风冷无法承载的整排八卡节点。但这属于具有独立交付周期的场地工程项目,因此更应在讨论之初而非结尾提出。
决策前需要落实的数据
单机柜实际可用功率(以 PDU 实测为准,而非建筑图纸标注);散热能力及是否具备冷却水源;楼板承重(千克每平方米);三相供电可用性,以及在稳态功耗之上的断路器余量,因为此类系统的瞬时峰值远高于典型功耗值。
上述每一项在下单之前都是可以确认的,而在下单之后则无一可控。