Lưu từ tháng 10 năm 2019

Passthrough, không phải chia sẻ thời gian

Mọi GPU chúng tôi bán là một card vật lý hoàn chỉnh gắn với một phiên bản. Chia sẻ thời gian sẽ cho phép chúng tôi bán mỗi card bốn lần, và chúng tôi đã tính toán chi phí một cách đúng đắn.

GPU实例本月在法兰克福、达拉斯和新加坡上线。两种配置可供选择:单块RTX 4000 Ada,20GB显存;单块L40S,48GB显存。两者均搭载于EPYC 9354P主机,通过PCIe 4.0全十六通道直连,直通至单个实例。

直通意味着网卡在启动时由虚拟机管理程序绑定到您的实例,并一直保持到您取消为止。没有调度器,没有队列,没有其他租户,也没有其他人同时使用的显存分区。

我们实际做出的决定

在租户之间对GPU卡进行时间切片是一种受支持、有文档记录且完全合法的经营方式。我们花了大约三周时间对其成本进行评估,因为其算术很有吸引力:一块48GB的卡可以呈现为四个12GB的实例,也就是一次购买获得四份租金,一份电力预算获得四个客户。

然后我们运行了尾部延迟测试。

共享卡在其他租户空闲时表现良好,但一旦他们活跃起来就令人不快。当卡上有三个活跃租户时,推理延迟的中位数大致符合预期,但在第99百分位上则差四到九倍,具体取决于其他人当时在做什么。训练任务更糟,因为训练任务不是突发性的,因此永远无法利用空隙。

还有许可证问题。使清晰分区成为可能的虚拟化软件每卡每年需支付许可费,且该成本不会消失;它会落在任何租用该分片的用户的账单上。我们本会为您收取共享的特权费用。

主机架构

元素内容
主机CPUEPYC 9354P,三十二核,ECC DDR5-4800
连接PCIe 4.0,十六通道,每卡一个IOMMU组
vCPU绑定绑定到卡所在的插槽和NUMA节点
内存从同一NUMA节点分配,绝不交织
每节点卡数最多四张,多数站点两张,受机架电力限制
端口40 Gbit/s,因为无法容纳于显存的模型必须从某处加载

NUMA绑定比规格表所显示的更重要。位于错误插槽上的vCPU通过互连向卡传输数据会损失实际吞吐量,这是我们见到的其他GPU主机上最常见的错误配置。

电力,以及为什么只有三个站点

一张350瓦的卡改变了机架的算力。能够轻松容纳十二个通用节点的站点只能容纳四个GPU节点,然后冷却就耗尽了。选择法兰克福、达拉斯和新加坡是因为这三个站点都有电力余量,且布局能够承受这种密度,无需重新协商。

随着电力允许,更多站点将相继推出,而实际的限制总是电力而非需求。如果站点无法承受负载,我们宁愿不销售该产品,也不愿以热节流的方式销售。

您不能做什么

  • 不支持跨节点卡配对。 双卡实例存在,且两张卡均位于同一NUMA节点。更大规模则需要讨论裸机。
  • 不支持在实例内部进行分区。 您拥有整张卡,如何划分由您和您的框架决定。
  • 不支持热插拔。 更换GPU意味着重建,因为卡在启动时绑定。
  • 不支持消费级游戏卡。 每周都会被问及。它们缺乏适用于机架的散热设计,且在大多数情况下,根本无出租许可。

定价,直白地说

显卡有其成本,利润率比目录中其他产品更薄。没有按小时计费,因为专用硬件的小时计费意味着保持卡空闲,并向其他所有人收取特权费用。按月计费,提供标准七天退款,并与其他所有产品一样仅支持加密货币支付。

如果您的工作负载确实是突发性的且按小时计费,那么我们不是合适的供应商,大型云服务商才是。只要我们拒绝时间切片,这种情况就会一直存在,而那是无限期的。

Sẵn sàng khi bạn cần

Chọn thành phố. Chọn kích thước. Thanh toán bằng coin.

Không có biểu mẫu về bạn là ai, không chờ đợi con người phê duyệt, không gọi điện thoại để xác minh bất cứ điều gì. Hóa đơn được thanh toán và thông tin đăng nhập sẽ vào hộp thư của bạn.