GPU实例本月在法兰克福、达拉斯和新加坡上线。两种配置可供选择:单块RTX 4000 Ada,20GB显存;单块L40S,48GB显存。两者均搭载于EPYC 9354P主机,通过PCIe 4.0全十六通道直连,直通至单个实例。
直通意味着网卡在启动时由虚拟机管理程序绑定到您的实例,并一直保持到您取消为止。没有调度器,没有队列,没有其他租户,也没有其他人同时使用的显存分区。
我们实际做出的决定
在租户之间对GPU卡进行时间切片是一种受支持、有文档记录且完全合法的经营方式。我们花了大约三周时间对其成本进行评估,因为其算术很有吸引力:一块48GB的卡可以呈现为四个12GB的实例,也就是一次购买获得四份租金,一份电力预算获得四个客户。
然后我们运行了尾部延迟测试。
共享卡在其他租户空闲时表现良好,但一旦他们活跃起来就令人不快。当卡上有三个活跃租户时,推理延迟的中位数大致符合预期,但在第99百分位上则差四到九倍,具体取决于其他人当时在做什么。训练任务更糟,因为训练任务不是突发性的,因此永远无法利用空隙。
还有许可证问题。使清晰分区成为可能的虚拟化软件每卡每年需支付许可费,且该成本不会消失;它会落在任何租用该分片的用户的账单上。我们本会为您收取共享的特权费用。
主机架构
| 元素 | 内容 |
|---|---|
| 主机CPU | EPYC 9354P,三十二核,ECC DDR5-4800 |
| 连接 | PCIe 4.0,十六通道,每卡一个IOMMU组 |
| vCPU绑定 | 绑定到卡所在的插槽和NUMA节点 |
| 内存 | 从同一NUMA节点分配,绝不交织 |
| 每节点卡数 | 最多四张,多数站点两张,受机架电力限制 |
| 端口 | 40 Gbit/s,因为无法容纳于显存的模型必须从某处加载 |
NUMA绑定比规格表所显示的更重要。位于错误插槽上的vCPU通过互连向卡传输数据会损失实际吞吐量,这是我们见到的其他GPU主机上最常见的错误配置。
电力,以及为什么只有三个站点
一张350瓦的卡改变了机架的算力。能够轻松容纳十二个通用节点的站点只能容纳四个GPU节点,然后冷却就耗尽了。选择法兰克福、达拉斯和新加坡是因为这三个站点都有电力余量,且布局能够承受这种密度,无需重新协商。
随着电力允许,更多站点将相继推出,而实际的限制总是电力而非需求。如果站点无法承受负载,我们宁愿不销售该产品,也不愿以热节流的方式销售。
您不能做什么
- 不支持跨节点卡配对。 双卡实例存在,且两张卡均位于同一NUMA节点。更大规模则需要讨论裸机。
- 不支持在实例内部进行分区。 您拥有整张卡,如何划分由您和您的框架决定。
- 不支持热插拔。 更换GPU意味着重建,因为卡在启动时绑定。
- 不支持消费级游戏卡。 每周都会被问及。它们缺乏适用于机架的散热设计,且在大多数情况下,根本无出租许可。
定价,直白地说
显卡有其成本,利润率比目录中其他产品更薄。没有按小时计费,因为专用硬件的小时计费意味着保持卡空闲,并向其他所有人收取特权费用。按月计费,提供标准七天退款,并与其他所有产品一样仅支持加密货币支付。
如果您的工作负载确实是突发性的且按小时计费,那么我们不是合适的供应商,大型云服务商才是。只要我们拒绝时间切片,这种情况就会一直存在,而那是无限期的。