自2019年10月起持续记录

直通,而非时间切片

我们销售的每块 GPU 都是一整块物理卡,绑定到一个实例。时间切片本可以让我们把每张卡卖四次,而我们对它做了恰当的成本核算。

GPU 实例本月在法兰克福、达拉斯和新加坡上线。两种配置可供选择:单个 RTX 4000 Ada,配备二十 GB 显存,以及单个 L40S,配备四十八 GB。两者均搭载于 EPYC 9354P 主机,通过 PCIe 4.0 全十六通道连接,直通到一个实例。

直通意味着显卡在启动时由虚拟机监控程序绑定到您的实例,并一直保持直到取消。没有调度器,没有队列,没有其他租户,也没有其他人在使用的显存分区。

我们实际所做的决定

在租户之间对显卡进行时间切片是一种受支持、有良好文档记录且完全合法的业务运营方式。我们花了大约三周时间计算成本,因为这项算数很有吸引力:一张四十八 GB 的显卡可以呈现为四个十二 GB 的实例,即从一次购买中获得四次租金,从一份电力预算中服务四位客户。

然后我们运行了尾部延迟测试。

共享显卡在其它租户空闲时没问题,但在他们活跃时就令人不快。有三个活跃租户卡片上的推理延迟大致符合中位数预期,而在第 99 百分位上则差四到九倍,具体取决于其他人在做什么。训练任务更糟糕,因为训练任务不是突发的,因此永远得不到间隙。

还有许可问题。使干净分区成为可能的虚拟化软件承担每卡年度许可费,这笔费用不会消失;它会落在租用分片者的账单上。我们本来会为了分享的特权而向您收费。

主机的构建方式

组件说明
主机 CPUEPYC 9354P,三十二核心,ECC DDR5-4800
连接PCIe 4.0,十六通道,每个显卡一个 IOMMU 组
vCPU 绑定绑定到显卡所在的插槽和 NUMA 节点
内存从同一 NUMA 节点分配,绝不交错
每节点显卡数最多四个,大多数站点两个,受机架电力限制
端口40 Gbit/s,因为不适合显存的模型必须从某处加载

NUMA 绑定比规格表所暗示的更重要。连接到错误插槽的 vCPU,通过互联传输数据时会损失实际吞吐量,这是我们在其他 GPU 主机上看到的最常见错误配置。

电力,以及为什么只有三个站点

一张三百五十瓦的显卡改变了机架的算术。能轻松容纳十二个通用节点的站点只能容纳四个 GPU 节点,然后制冷耗尽。法兰克福、达拉斯和新加坡之所以被选中,是因为这三个站点都有电力余量,并且平面布局能承受这种密度,无需重新谈判。

随着电力允许,更多站点会跟进,而真正的限制总是电力而非需求。如果站点无法承受负载,我们宁可不销售该产品,也不愿以热节流的方式销售。

您不能做什么

  • 跨节点显卡配对。 双卡实例存在,但两张卡都位于一个 NUMA 节点上。任何更大的规模都需要探讨裸机。
  • 实例内分区。 您拥有整张卡,如何划分是您和框架之间的事。
  • 热插拔。 更换 GPU 需要重建,因为显卡在启动时绑定。
  • 消费级游戏显卡。 每周都有人问。它们缺乏适用于机架的散热配置,而且在大多数情况下,也缺乏出租许可。

定价,简明扼要

这些卡的成本就是这样,利润率比目录中的其他产品更薄。没有按小时计费,因为按小时计费于专用硬件意味着持有空闲显卡,并向其他所有人收取特权费用。按月计费,采用标准的 七天退款,以及与其他所有产品相同的仅加密货币支付。

如果您的工作负载确实具有突发性且按小时计费,那么我们不是合适的供应商,大型超大规模云服务商才是合适的。只要我们拒绝时间切片,这种情况就会持续下去,而这将是无限期的。

随时恭候

选择城市,选择大小,用加密货币支付。

无需填写关于您的身份信息的表格,无需等待人工审批,无需电话验证。账单结清后,凭证将发送到您的邮箱。