Alchemist Server 正式上线。欢迎浏览我们的 AI 基础设施产品线,或与我们的团队沟通定制方案。联系我们的团队

Skip to main content

白皮书

加速计算的可持续性报告

作者:Alchemist Server

如何可信地测量并报告能耗,以及为何仅用 PUE 指标会低估 AI 负载的实际情况。

要可信地报告加速计算的能源使用情况,仅有 PUE 是不够的,该指标在若干对 AI 负载尤为关键的方面低估了实际情况。

为何 PUE 会低估实际情况

PUE 衡量的是场地开销相对于 IT 负载的比值,它完全不反映 IT 负载是否在完成有效工作。利用率 40% 的集群与 80% 的集群可以报出相同的 PUE,却在相同能耗下产出差异巨大,而场地指标看起来毫无区别。

对 AI 负载而言,这一差距尤为显著,因为闲置的加速器仍会消耗峰值功耗中相当大的一部分。因此,仅报告 PUE 只描述了建筑的效率,却对计算本身的效率只字未提。

应当一并报告的指标

单位有效工作量所消耗的能源,才是真正反映效率的数字:视业务形态而定,可以是每次训练运行、每百万个服务 token,或每次实验的能耗。该指标更难统计,但它会随利用率提升而改善,而真正的收益正来自于此。

利用率本身也应予以报告,但需附加本文库其他文章所述的说明:GPU 利用率百分比单独来看是一个很差的指标,实际达成的吞吐比内核驻留时间更为诚实。

制冷方案的选择应纳入报告

在本地区气候条件下,制冷占场地用电的比例相当可观,因此制冷策略是一项应予披露的决策,而非实现细节。省去冷水机组的温水冷却会实质改变场地能耗,且与多数效率类表述不同,它是一项正当且可验证的主张。

如实说明统计边界

应明确说明报告涵盖的范围。硬件的隐含碳排放、机房之外的网络设备,以及桌面系统上开发工作所消耗的能源,常常在未加声明的情况下被排除在外。如实说明的较窄边界,其可信度高于悄然划定的宽泛边界。

相关阅读

正在规划 AI 基础设施项目?

请告诉我们您的业务负载与可用的供电与散热条件,我们将提供具体配置方案、交货周期与正式报价。