五条产品线,一个决定
这里的每一行都很快。问题从来不是哪一行最好,而是你的瓶颈到底在哪一行——那是对你工作负载的考量,而不是对我们硬件的考量。
从工作负载开始
下面这张表是有人问该买什么时我们在内部用的。它故意写得很直白,因为对一个拿着预算的人来说,模糊的建议毫无价值。
找到你的那行。如果没有匹配的,找客服,用两行描述你的需求。
| 工作负载 | Ryzen | EPYC | GPU | 存储 | 独立服务器 | 原因 |
|---|---|---|---|---|---|---|
| 单热线程 | 购买此 | 较慢 | 没必要 | 没必要 | 如果尾部延迟重要 | 速度很重要,但要我说的话,只有时钟频率和每周期指令数能帮到无法拆分的线程 |
| 工作集超过 128 GB | 装不下 | 购买此 | 仅主机 | 没有 | 从 256 GB 起 | 双通道内存不够用了,这样大小的时候带寄存器的 ECC 才开始重要 |
| 带数据库的 Web 应用 | 购买此 | 长大了再说 | 没有 | 没有 | 很少 | 这种的绝大多数是占用一个核心和几十 GB,正好是 Ryzen 的层级 |
| 大量并发重查询 | 核心数不够用 | 购买此 | 没有 | 没有 | 延迟预算紧张时 | 十二个内存通道能喂饱 48 个线程;两个通道喂不饱 |
| 48 小时微调 | 没有 | 没有 | 购买此 | 没有 | 没有 | 整块卡直接穿透,留到任务结束,前面没有调度器 |
| 向外提供量化模型服务 | 没有 | 没有 | 购买此 | 没有 | 没有 | 是显存容量决定答案,20 或 48 GB 和一块 CPU 完全不同 |
| 40 TB 的种子盒 | 没地方放 | 没地方放 | 没有 | 购买此 | 坚持的话 | 大量容量放在 NVMe 后面,不限流量端口,价格是 NVMe 达不到的 |
| 其他服务器的备份目标 | 太小了 | 太小了 | 没有 | 购买此 | 没有 | 写一次,很少读,存很多年。机械盘一直是正确的选择 |
| 自己的虚拟化 | 嵌套,慢 | 从 32 核心起 | 没有 | 没有 | 购买此 | 在别人的虚拟机监控器上进行嵌套虚拟化是一种妥协;裸机可以去掉外层 |
| 转售虚拟机 | 没有 | 可能 | 没有 | 没有 | 购买此 | 您需要固件、分区和整台机器,以及为自己的客户提供可预测的行为 |
| 严格预算下第99百分位 | 好 | 好 | 没有 | 没有 | 最佳 | 缓存和中断无法完全隔离,因此单租户是关键的最后几个百分点 |
| 在十五个国家的边缘节点 | 购买此 | 二十七站点 | 八站点 | 十八站点 | 九站点 | Ryzen 是唯一在所有三十四个站点中都提供的产品线,这使其成为分散部署的默认选择 |
三个问题就能确定
我们给出的几乎每个推荐都来自同样简短的询问。你可以用分析器和计算器在十分钟内自己完成。
诚实回答这些问题,表格通常就不再必要了。
- 01
时间花在哪里?
查看火焰图或实际负载下的简单top。一个线程100%占用而其他空闲意味着Ryzen。四十个线程都忙则意味着EPYC。一切等待磁盘表示存储线或更多NVMe。一切等待GPU表示您已经知道答案。
- 02
必须驻留在内存中的部分有多大?
峰值时的常驻集大小,加上你真正受益的页缓存。低于 128 GB 会停留在 Ryzen 系列。超过的话,决定已经为你做好,EPYC 层级存在且大小如此正是这个原因。
- 03
一个小时的停机成本是多少?
如果诚实的答案是“不多”,那么一台机器就足够了,裸机是合理的奢侈。如果是一个严肃的数字,购买两个位于不同城市的较小虚拟实例,而不是一台大型机器,并在需要之前练习故障转移。
如果你不想独自完成,可以开一个工单,用两行描述工作负载。你会得到中位数为十一分钟的回复,偶尔那个回复是你应该购买更便宜的东西。
我们每周看到的四个错误
没有人因为这些错误是粗心而犯。它们源于根据计划而不是测量来确定机器规模。
每一个每周至少出现在工单队列中一次。
购买核心而不是时钟
一个四十八核实例运行单线程进程是我们出售的最昂贵的慢速方式。在发票之前检查配置文件;修复通常是购买一个较小的 Ryzen 实例,成本为三分之一,并且更快完成。
按太字节购买 NVMe
一旦你超过几个太字节,算术有利于在大量容量前面使用 NVMe 层的存储节点。人们通常在第二次容量升级后而不是第一次之前发现这一点。
为适合的工作负载购买裸机
单租户在尾部延迟和控制方面赚取价值。如果这两个词都不出现在你的需求中,那么具有专用核心的虚拟实例可以做同样的工作,部署时间不到一分钟,并且可以调整大小。
每行的共同点
无论你选择哪条产品线,底层平台的表现都是一致的。这是有意为之,使得在不同产品线之间切换成为一个数据问题,而不是重新学习的过程。
差异在于硅片。其他一切都刻意相同。
专属资源
核心是绑定的,内存在启动时保留,磁盘容量是厚置备的。每条产品线的超售比例均为零,包括最便宜的那条。
相同的网络
专属端口,在公布的公平使用原则下不限流量,并且永久的路径上提供高达每秒 12 Tbit/s 的边缘清洗。所有产品均包含一个路由的 IPv6 /64 地址。
相同的面板和 API
一个地方即可构建、快照、重建、调整大小和读取遥测数据。面板能做的任何事,API 都能做,因为面板就是基于 API 编写的。
相同的政策
注册只需一个电子邮件地址。通过 OxaPay 使用加密货币支付。在任何阈值、任何产品线、任何订单金额下,均无文件要求。
相同的承诺
合同规定每月 99.99% 正常运行时间,并自动补偿;首次响应中位数为 11 分钟;七天无理由退款。
改变主意
在真实流量到达之前,配置大小只是猜测。在这里明智的购买方式是先猜测一个较小的配置,进行测量,并在获得数据后进行调整。
比起在第四个月发生争执,这样对我们双方都更省钱。
在产品线内,升级通常只需重启:在节点有余量的情况下,内存和 NVMe 可以原地增长;如果节点无法吸收跳跃,我们会与你协商安排实时迁移。跨产品线则是新实例和复制,这也是为什么我们建议从第一天起就让你的构建可复现,而不是等到第三个月。
定期折扣从季度5%到两年35%不等。若您仍在摸索,按月购买。一旦工作负载形态不再出现意外,再承诺一年,因为折扣不足以让您锁定错误机器。
第一周可退款
七天,无需理由,以你支付的资产退还。认真的测试花费的是你的注意力而不是金钱。
快照让实验变得便宜
在你对任何更改不确定之前,先拍一张快照。恢复只需几秒钟,这将有风险的升级变成可逆的操作。
支持人员会劝你降级
告诉我们你想运行什么,我们会告诉你用哪条最便宜的产品线。向客户出售一台他们不满意的机器,不是留住客户五年的好方法。
Ryzen NVMe
Highest single-core throughput
EPYC High-Memory
Core count and RAM, at scale
GPU Instances
Passthrough, not time-sliced
| 方案 | 专用核心 | 内存 | NVMe 存储 | 显卡 | 端口速度 | 价格 | |
|---|---|---|---|---|---|---|---|
| G-ADA Inference and light training | 8 | 64 GB | 1 TB | 1 × RTX 4000 Ada · 20 GB | 40 Gbit/s | €239.00 /月 | 配置 |
| G-L40S最常用 48 GB of VRAM, undivided | 16 | 128 GB | 2 TB | 1 × L40S · 48 GB | 40 Gbit/s | €749.00 /月 | 配置 |
| G-L40S×2 Two cards, one NUMA node | 32 | 256 GB | 4 TB | 2 × L40S · 96 GB | 40 Gbit/s | €1420.00 /月 | 配置 |
价格不含增值税(如适用)。 流量: 不限量,公平使用.
Storage Nodes
Bulk capacity, real IOPS
Bare Metal
Nothing between you and the board
关于选择的问题
不是。9354P 核心比 9950X 核心慢,对于单线程工作,桌面级部件以舒适的差距胜出。EPYC 在内存容量、每核心内存带宽、纠错和总吞吐量方面胜出。根据你的瓶颈所在选择。
大多数人这样做的。一个 Ryzen 实例在前端,一个 EPYC 实例承载数据库,以及一个位于其他城市的存储节点用于备份,这是我们最常见的部署形态。我们站点之间的流量通过我们的骨干网络传输。
它们位于同一平台,合同规定的正常运行时间相同。实际差异在于恢复时间:小型虚拟实例恢复最快,大型实例需要更长时间来重新填充,而裸金属服务器则完全没有实时迁移支持。
提交一个包含两行描述的工单。答案将在中位数 11 分钟内到达,并且会指明一条产品线,而不是三个,因为菜单不是建议。
不提供。廉价层已于 2021 年删除,并且不会回归。它产生了大部分支持负载以及几乎所有滥用报告,而删除它正是本页其余内容能够做出承诺的原因。