Alchemist Server 正式上线。欢迎浏览我们的 AI 基础设施产品线,或与我们的团队沟通定制方案。联系我们的团队

Skip to main content

技术指南

真正有意义的 GPU 利用率监控

作者:Alchemist Server

单看利用率百分比参考价值有限。当集群性能不佳时,应当监测哪些指标。

GPU 利用率百分比单独来看是一个很差的指标,集群常常被报告为繁忙状态,实际却几乎没有完成多少有效工作。

该数值统计的是是否有内核驻留,而非该内核是否在产生实际成果。一个在内存受限操作上空转的 GPU、一个正在等待集合通信结果的 GPU,或一个处理的批量远不足以填满自身的 GPU,都会报告较高的利用率。集群显示 90% 利用率却让人感觉很慢,是常态而非异常。

应当改为测量什么

实际占用率与内存带宽利用率能够说明加速器所完成的工作是否与其能力相称。集合通信耗时占单步耗时的比例,能够说明网络是否成为瓶颈。数据加载等待时间,则能说明存储是否成为瓶颈。这三项指标通常足以定位系统中究竟是哪一部分在决定整体速率。

对于为集群付费的人而言,真正重要的数字是单步耗时,建议将其作为核心指标进行跟踪,并把上述其他指标作为其下层的诊断依据。

通常的答案

当集群运行缓慢时,原因多数出在数据通路而非加速器。若存储层无法持续提供节点所需的读取速率,其表现恰恰就是上文描述的形态:报告利用率高、实际吞吐低,且任何位置都不报错。在着手优化 GPU 之前,请先检查数据加载环节。

相关阅读

正在规划 AI 基础设施项目?

请告诉我们您的业务负载与可用的供电与散热条件,我们将提供具体配置方案、交货周期与正式报价。