白皮书
加速计算的可持续性报告
如何可信地测量并报告能耗,以及为何仅用 PUE 指标会低估 AI 负载的实际情况。
要可信地报告加速计算的能源使用情况,仅有 PUE 是不够的,该指标在若干对 AI 负载尤为关键的方面低估了实际情况。
为何 PUE 会低估实际情况
PUE 衡量的是场地开销相对于 IT 负载的比值,它完全不反映 IT 负载是否在完成有效工作。利用率 40% 的集群与 80% 的集群可以报出相同的 PUE,却在相同能耗下产出差异巨大,而场地指标看起来毫无区别。
对 AI 负载而言,这一差距尤为显著,因为闲置的加速器仍会消耗峰值功耗中相当大的一部分。因此,仅报告 PUE 只描述了建筑的效率,却对计算本身的效率只字未提。
应当一并报告的指标
单位有效工作量所消耗的能源,才是真正反映效率的数字:视业务形态而定,可以是每次训练运行、每百万个服务 token,或每次实验的能耗。该指标更难统计,但它会随利用率提升而改善,而真正的收益正来自于此。
利用率本身也应予以报告,但需附加本文库其他文章所述的说明:GPU 利用率百分比单独来看是一个很差的指标,实际达成的吞吐比内核驻留时间更为诚实。
制冷方案的选择应纳入报告
在本地区气候条件下,制冷占场地用电的比例相当可观,因此制冷策略是一项应予披露的决策,而非实现细节。省去冷水机组的温水冷却会实质改变场地能耗,且与多数效率类表述不同,它是一项正当且可验证的主张。
如实说明统计边界
应明确说明报告涵盖的范围。硬件的隐含碳排放、机房之外的网络设备,以及桌面系统上开发工作所消耗的能源,常常在未加声明的情况下被排除在外。如实说明的较窄边界,其可信度高于悄然划定的宽泛边界。