Alchemist Server 正式上线。欢迎浏览我们的 AI 基础设施产品线,或与我们的团队沟通定制方案。联系我们的团队

Skip to main content

技术指南

PCIe 还是 SXM:这一选择的实际代价

作者:Alchemist Server

插槽式八卡与基板式八卡并非同一产品的两个价位档。前者可维护,后者卡间带宽更高,究竟哪一项更重要,取决于具体负载。

两台八卡 GPU 服务器之间的差异,可能远不止价格。一种将加速卡安装在 PCIe 插槽中,另一种则将其焊接在基板上,并在卡间配备专用互联通道。这并非档次之分,而是面向不同用途的两类设备。

SXM 带来什么

基板设计在每两颗 GPU 之间提供高带宽直连。当模型规模超出单卡容量、必须切分到八颗卡上时,训练的每一步都需要在卡间传递激活值,此时的瓶颈是这部分通信,而非运算本身。在 PCIe 架构下,同样的流量需要经过与其他设备共享的总线。

因此,对于需要横跨整个节点进行训练的模型,互联能力是决定吞吐的关键规格,datasheet 上的其他任何参数都无法弥补这一差距。

PCIe 带来什么

插槽中的加速卡可以拆卸,可以更换为其他型号,可以在故障后单独更换而无需返修整机,也可以在后期增配。未安装 GPU 的插槽还可用于网络适配卡或存储控制器。

对于推理场景,这种灵活性的价值高于互联带宽,因为模型通常可在一到两张卡上完整运行,各加速卡彼此独立工作而非同步协作。当部署需要在五年内应对需求变化时,这种灵活性同样更有价值:设备可以重新配置,而不必整机更换。

真正决定选择的问题

是单个任务需要同时占用全部 GPU,还是多个任务各自只需要一到两张卡?

大模型训练属于前者,服务多个模型或同一模型的多个副本属于后者。多数机构两者兼有,这也是混合部署常见的原因,以及两类设备互为选项而非升级关系的原因。

报价前我们会确认什么

您计划训练的最大模型规模,以及它是否能放入单张加速卡的显存。若可以,PCIe 方案的性价比通常明显更高;若不可以,互联能力就不再是一项配置,而是整个方案的设计核心。

相关阅读

正在规划 AI 基础设施项目?

请告诉我们您的业务负载与可用的供电与散热条件,我们将提供具体配置方案、交货周期与正式报价。