当工作集不再适用时
当数据不再适合内存时,手册中的每一个调优技巧都不再有用。这条产品线的存在就是为了让它继续适用:registered ECC DDR5、真实的服务器拓扑,以及足够的核心来发挥其作用。
When the working set stops fitting in RAM, nothing else you tune matters. This line exists so that it keeps fitting: ECC memory, real server topology, and enough cores to use it.
| 方案 | 专用核心 | 内存 | NVMe 存储 | 端口速度 | 价格 | |
|---|---|---|---|---|---|---|
| E-8 Entry into ECC | 8 | 64 GB | 500 GB | 25 Gbit/s | €89.00 /月 | 配置 |
| E-16最常用 The workhorse tier | 16 | 128 GB | 1 TB | 25 Gbit/s | €165.00 /月 | 配置 |
| E-32 A full socket | 32 | 256 GB | 2 TB | 25 Gbit/s | €310.00 /月 | 配置 |
| E-48 Half a terabyte of RAM | 48 | 512 GB | 4 TB | 25 Gbit/s | €580.00 /月 | 配置 |
价格不含增值税(如适用)。 流量: 不限量,公平使用.
AMD EPYC 9354P · Zen 4 · 32C/64T · ECC DDR5-4800 · NUMA-aware pinning
三十四个城市,二十九个国家
延迟数据来自我们自己探针的测量中位数,而非供应商手册。它们会变化;页面会随之更新。
服务器芯片的用途
配备大散热器的桌面级芯片不是服务器。区别不在于徽标,而在于内存容量、内存纠错、PCIe 通道数以及同时保持每个核心都处于忙状态的能力。
EPYC 9354P,三十二核心,十二通道内存,单路。
9354P 提供单路三十二个 Zen 4 核心和六十四个线程,连接到十二通道的 registered DDR5-4800。十二通道是关键。在双通道的桌面平台上,十六个繁忙的核心会将其工作时间中有意义的一部分用于等待内存而不是计算;而在这里则不会。
单路也是刻意设计的。没有第二个处理器需要访问,没有需要饱和的处理器间链路,也没有调度器将你的线程放在机器一侧而内存位于另一侧的风险。少一些出错的可能,就意味着更少的“昨天还好好的”之类的工单。
单实例最高半 TB 内存
最高配置配备五百一十二 GB 的纠错内存。分析型数据库、内存缓存、JVM 堆(不管有没有人敢去分析)——所有这些都无需分片项目即可容纳。
核心保持同时忙碌
四十八个线程同时进行实际工作与一个线程快速完成是不同的挑战。每个核心的带宽是使后一种情况成为可能的因素,而这正是任何主频的桌面平台都无法匹敌的数字。
PCIe 通道充足
足够的通道意味着 NVMe、网络和透传设备不会争用同一条狭窄路径。这正是 GPU 和存储产品线使用相同主机平台的原因。
平稳可预测,而不是峰谷急变
这里的时钟频率低于Ryzen系列,且平坦得多。对于任何以第99百分位衡量延迟预算的工作负载,平坦比快速更有价值。
ECC,以及它实际的作用
内存错误并不罕见。在大型服务器群中,它们每周都会发生,而在没有纠错功能的机器上,它们悄无声息地发生——这才是你应该担心的部分。
纠错不是一个复选框。而是一份你可以读取的日志。
registered ECC DDR5-4800 可以在传输过程中纠正单比特错误并检测多比特错误。被纠正的错误会变成日志中的一行,而不是结果集中的错误数字。当一个内存模组开始以我们不希望看到的频率产生错误时,它会在计划维护窗口内被更换,以免演变成不可纠正的错误和计划外重启。
这的实际意义不是可靠性理论,而是:一个数据库的页缓存中有一个位被翻转,它不会崩溃:它会将翻转的值写入磁盘,忠实地复制到每个备用节点,然后让你在六周后某个报告自相矛盾时发现问题。
你自己实例的纠错计数器可在面板中查看。如果你想自己观察,也可以通过 API 获取相同的数据。
谁不该购买此产品
服务器芯片并不自动是更好的选择。它仅仅是针对特定而且相当狭窄的问题集的更好选择。
一半想要 EPYC 的用户其实需要的是 Ryzen 产品线加上一个好觉。
你的瓶颈是单线程
9354P核心比9950X核心慢,任何内存带宽都无法改变这一点。如果您的分析器显示一个线程100%占用而三十一个核心空闲,那么您选错了产品线。
You are buying it for the badge
Nothing about a workload becomes enterprise-grade because it runs on a part with EPYC written on it. Buy this when the memory figure or the core count is genuinely the constraint, and buy the cheaper line when it is not.
You need forty terabytes
The NVMe here tops out in the low single-digit terabytes. Bulk capacity lives in the storage line, on the same host platform, at a fraction of the cost per terabyte.
You want a GPU in it later
Cards are not added to running EPYC instances. The GPU line exists because passthrough requires the host to be laid out for it from the start.
You want the whole machine
From the E-32 tier upward you are holding a full socket, but the hypervisor is still ours. If your requirement is your own kernel, your own scheduler or nested virtualisation at full speed, buy metal instead.
Allocation, and where NUMA comes in
Buying memory is easy. Making sure the cores that use it are physically near it is the part that distinguishes a server platform from a spreadsheet of specifications.
Pinned cores, reserved memory, and both on the same side of the machine.
Cores are pinned to physical cores, one tenant per core and its sibling thread, exactly as on the Ryzen line. What changes here is placement: your memory is allocated from the NUMA domain your cores sit in, so a memory access does not cross the fabric to reach the address it wants. Instances too large for one domain are pinned across the smallest number of domains that will hold them, and the topology is passed through, so your own scheduler can see the truth.
Two cores of the thirty-two are reserved for the hypervisor, storage and monitoring. The rest are sold once. When they are gone the site stops appearing in the configurator for this line, which is occasionally annoying and always honest.
| Resource | How it is allocated | What is shared |
|---|---|---|
| CPU cores | Pinned within a NUMA domain wherever the size allows | Nothing |
| 内存 | Reserved at boot from the local domain. Registered ECC | Nothing |
| Topology | Passed through, so your guest scheduler sees real distances | 不适用 |
| NVMe capacity | Thick-provisioned at creation | Nothing |
| Network port | Twenty-five gigabits per second, dedicated | Site uplink, engineered above the sum |
| Hypervisor overhead | Two reserved cores per node, outside your allocation | 不适用 |
Disks and the wire
The reference node carries four enterprise NVMe drives in mirrored pairs with a hot spare, and two twenty-five gigabit interfaces bonded to separate switches.
Four Gen4 NVMe per node, mirrored, on a twenty-five gigabit port.
Mirrored, with power-loss protection
Writes acknowledge from capacitor-backed cache. A power event flushes that cache rather than discarding it, which is the difference between a clean journal replay and a long evening.
Bonded uplinks, separate switches
Two interfaces in a link aggregation group landing on distinct switches. A switch reboot costs you a few dropped packets rather than an outage.
Filtering that is already on
边缘清洗能力高达每秒十二太比特,始终在路径上。攻击开始时无需启用任何东西,因为它在攻击开始时已经在过滤。
不计量,已公布数字
在二十五吉比特端口上合理使用为每月一百五十太字节。该数字写在定价页面上,而不是留空以便日后对你不利。
自带IP地址
从E-32及以上等级,在上游允许的站点,你可以宣告自己的IP空间。提交包含对象详情的工单,我们会在一天内回复。
四十吉比特,如果需要
此产品线在站点具备后备容量的地方提供专用四十吉比特端口。这是一个付费选项,价格在定价页面上,大多数人不需要它。
运行位置与迁移
七个站点不提供:雷克雅未克、索非亚、基希讷乌、巴拿马城、圣地亚哥、孟买和约翰内斯堡。这些是Ryzen和存储站点,配置器会在你产生想法之前告诉你。
三十四个站点中有二十七个提供EPYC容量。
其他所有站点都有,包括全部五个北美站点和除孟买外的所有亚洲站点。法兰克福和阿姆斯特丹容量最多,并首先获得新硬件。苏黎世有EPYC但限量供应,因为那里的机架空间价格就是苏黎世的机架空间价格。
- 01
按内存而非核心数选择
计算峰值时的常驻集大小,加上你的页面缓存真正赚到的部分,然后购买该数值以上的等级。此产品线的核心数往往作为内存数字的结果而非单独决策。
- 02
按月测试
在承诺以折扣价购买两年之前,先以一个月为期限获取一个实例。七天退款涵盖第一周,如果答案是否定的。
- 03
通过线路迁移数据
二十五吉比特和不计量流量使多太字节的复制成为隔夜工作。对于更大的数据,请向支持询问种子迁移,而不是发明快递计划。
- 04
记住拓扑结构
如果你的应用程序固定其线程,请阅读我们暴露的拓扑结构,而不是假设一台扁平机器。弄错这一点是迁移看起来比替换的硬件更慢的最常见原因。
- 05
可能的话在原地扩展
内存和NVMe在同一节点上有空间时进行扩展。节点无法吸收的跳跃变为实时迁移,与你协商安排,通常在一个工作日内完成。
当节点故障时
大型实例恢复时间更长,因为半太字节的内存必须从某处填充。我们宁愿这么说,也不愿暗示其他。
与车队其他部分相同的故障路径,但有更多内存需要重新填充。
驱动器故障由镜像和热备件吸收,不影响你的实例。内存模块变坏通常在校正计数上升时被发现,在变为不可纠正错误之前,并在与你协商的时间窗口内更换。这两者都是常规操作,都不是事故。
完全丢失的节点会在同一站点重建到备用硬件上,你的地址会跟随。小型实例的重启需要几分钟。在最大等级上,诚实的数字更接近半小时,大部分时间花在移动数据而非决定做什么。
校正次数可自行读取
你不必只相信我们对你实例下内存健康状况的描述。计数器可在面板和API中查看。
自动退款
合同规定的正常运行时间为每月99.99%。未能达到会自动在你的账户中存入积分,无需索赔表格、电话或关于因果关系的争论。
复制优于希望
单个实例就是一个实例,无论硬件成本如何。如果工作负载不能失去三十分钟,就在第二个站点运行备用实例,并在需要之前演练故障转移。
关于本产品线的问题
因为这是目前我们能够批量采购、上架并冷却的型号,价格也符合该系列的定位。9354P 是成熟的产品,热特性已知,固件不会出意外。当更新一代的服务器对整支机队有意义时,我们会通过更新日志公布,而不会悄悄替换现有实例。
每个节点配备十二条带寄存器的 DDR5-4800 内存模块,纠错开启,计数器可读。您可以在面板或通过 API 查看。任何声称支持 ECC 却不展示计数器的人,都只是在让您相信一份规格表。
从 E-32 套餐起可以,并且有现成的镜像。嵌套虚拟化可以使用,但会带来实际的性能损失。如果嵌套客户机才是真正的产品,那么裸金属是更诚实的答案。
如果数据库可以完全放入 Ryzen 的内存,并且查询大多是单线程的,那么 Ryzen 在延迟上胜出,成本也更低。一旦工作集超过一百二十八 GB,或者同时运行大量昂贵查询,EPYC 的优势会随着问题规模扩大而更加明显。
您的 CPU 和内存会分配在同一个域内,访问不会跨内部互联。对于超出单个域的实例,我们会使用最少数量的域,并将真实拓扑传递给您,让您自己的调度器不必猜测。
从 E-32 套餐起,可以在上游允许的站点进行。请通过工单提交对象详情,我们会在一天内答复您,如果该站点无法支持,也会直接告知您。