制约下一代集群的不是 GPU,而是电力
多数集群方案以 GPU 数量为起点进行规划,随后才发现机房无法满足供电需求。从供电条件反向推导,才能得到真正可运行的设计。
由系统构建团队撰写的技术指南、参考架构、产品发布信息与行业分析。
多数集群方案以 GPU 数量为起点进行规划,随后才发现机房无法满足供电需求。从供电条件反向推导,才能得到真正可运行的设计。
插槽式八卡与基板式八卡并非同一产品的两个价位档。前者可维护,后者卡间带宽更高,究竟哪一项更重要,取决于具体负载。
没有地面网络的场地依然可以在本地运行推理,但无法在无人管理的状态下运行,而这才是首先需要解决的问题。
多数机构将开发工作放在集群上,只因为 GPU 在那里,随后又困惑于训练队列为何始终无法疏通。
如何可信地测量并报告能耗,以及为何仅用 PUE 指标会低估 AI 负载的实际情况。
队列设计、公平共享策略,以及为何将开发工作移出集群通常是回报最高的改进措施。
批次大小、内存带宽与互联性能共同决定单 token 成本。本文对相关权衡进行建模分析。
以五年部署周期为基础,对设备、电力、散热、占地与人力成本进行建模,而非仅比较采购价格。
瞬时峰值远高于稳态功耗。应预留多少余量,以及为何铭牌参数具有误导性。
临界点约在单机柜 40kW,其原因在于所需风量而非能效。越过该临界点会发生什么变化,以及相应的成本。
在单机柜 20kW、40kW 与 80kW 三种功率下的直接对比,涵盖运营成本与故障模式。
何时单层拓扑即可满足需求、何时必须采用胖树架构,以及为未实现的扩容过度设计所付出的代价。