Alchemist Server 正式上线。欢迎浏览我们的 AI 基础设施产品线,或与我们的团队沟通定制方案。联系我们的团队

Skip to main content

白皮书

大模型推理服务的经济性分析

作者:Alchemist Server

批次大小、内存带宽与互联性能共同决定单 token 成本。本文对相关权衡进行建模分析。

单 token 成本由批大小、内存带宽与互联能力共同决定。孤立地优化其中任何一项,通常只是把成本转移到别处。

批大小

增大批量可提升吞吐并降低单 token 成本,直至延迟超出服务可接受的上限。该上限是产品决策而非工程决策,且应在确定硬件规格之前就明确下来,因为它决定了加速器中究竟有多大比例能够被真正利用。

未设定延迟目标即确定规格的推理服务层,往往按峰值吞吐配置,实际却长期运行在远低于设计值的批大小上,而这是一种代价高昂的方式来发现真实需求。

内存带宽

大模型推理受带宽制约的情形,远多于受算力制约。每次前向传播都必须读取权重,因此无论可用 FLOPS 有多少,带宽都决定了每秒 token 数的上限。这正是 H200 级硬件在推理服务上仍具竞争力的原因:区分它与更新一代加速器的是训练能力,而推理服务层并不使用该能力。

互联

只有当模型无法装入单个节点时,互联才变得重要。若模型能够装入,昂贵的网络对推理服务毫无帮助;若无法装入,网络就会成为每一次请求的组成部分,而不再是偶发的集合通信,并主导整体延迟。

由此得出的实际结论是:模型放置方式是一项经济决策。通过量化或选择适合推理的模型变体,把模型控制在单节点之内,其价值往往高于任何硬件升级。

再谈利用率

按峰值配置、却大部分时间处于闲置的推理集群,是在为未被使用的容量付费。应当驱动规格决策的,是平均负载下而非峰值下的单 token 成本。

相关阅读

正在规划 AI 基础设施项目?

请告诉我们您的业务负载与可用的供电与散热条件,我们将提供具体配置方案、交货周期与正式报价。