自2019年10月起持续记录

将整个机群迁移至Zen 4

在接下来九个月内,每个生产节点将逐步迁移至当前代EPYC或Ryzen芯片,一次一节,有公布窗口,无静默重启。

从一月开始,机群中的每个节点都将迁移到当前一代的硅片:服务器和存储产品线采用 EPYC 9004 系列,通用产品线采用 Ryzen 7000 系列。该计划大约需要九个月。到计划结束时,将不会有任何旧一代的硬件承载客户工作负载。

这是我们对运行中机群所做的最大规模的操作,值得在开始之前而不是之后进行解释。

为什么是现在

现有机群混合了两代以前的硬件,这在 2020 年还说得过去,但去年某个时候开始就站不住脚了。三件事同时发生了变化:带 ECC 的 DDR5 内存以服务器产品线所需的容量面市,每个插槽的内存带宽提升到了足以影响内存密集型客户的程度,而且旧部件的每核性能已经不再是我们想在价格旁边印的数字。

还有一个更平淡的原因。一个拥有三代硬件的机群需要三套备件、三个合格性测试流程和三套固件需要跟踪。整合到一代可以消除一整个类别的凌晨两点的意外。

顺序

阿姆斯特丹最先,因为所有东西都先发往 AMS-01,而且一直如此。法兰克福、伦敦和纽约随后,然后是剩余的欧洲站点,接着是亚太,最后是美洲。流程稳定后大约每周十四台节点,初期会少一些,因为我们还在摸索哪些地方会出错。

迁移期间新开的站点将直接使用新世代硬件,永远不会看到旧世代。

你会经历什么

工作负载支持的地方进行热迁移。 大多数实例在主机之间迁移,停顿时间在几百毫秒的范围内。如果你在查看图表,你会看到它,否则不会注意到。

不支持的地方进行计划重启。 使用 GPU 透传、固定设备的内核或任何持有硬件状态的实例无法热迁移。这些实例会获得一个时间窗口。

提前五个工作日通过电子邮件通知,并给出具体时间窗口。 不会是一个月的模糊通知。如果我们错过了已宣布的时间窗口,SLA 积分将自动适用,无需任何人开工单。

价格不变。 新世代的成本与旧世代相同。我们不收取世代附加费,也不会为没有阅读邮件的客户保留旧硬件并打折。旧硬件会离开机房。

唯一需要检查的事情

CPU 功能集发生了变化,新的服务器部件上出现了 AVX-512,而以前没有。使用功能检测进行编译,什么都不会发生。如果你固定了特定的标志集,或者你运行在启动时根据检测到的功能进行分派的数值代码,请在窗口之前而不是之后进行测试。

我们会在您站点的迁移通知中列出确切的标志差异。大约每两百个客户中有一个需要做任何事情,而且需要做的人已经知道他们是谁。

已经出了什么问题

首批四台服务器节点的一批注册 ECC DDR5 内存模块训练速度低于规定值,我们花了九天时间才确定是模块而非主板的问题。那九天就是为什么这个公告是在十二月而不是十月发布的原因。

供应是整个计划的风险。这些容量的服务器内存不是你能在短时间内采购到的,如果时间表延迟,那将是因为内存而不是因为我们能控制的任何事情。如果真的发生,我们会在这里说明。

我们不会做什么

我们不提供选择退出的选项。一个拥有长期拒绝迁移的客户尾巴的机群将永远有一个旧世代,而这个尾巴会成为没人愿意维护的东西。所有东西都会迁移。

我们也不会借此机会更改计划规格。相同的核心、相同的内存、相同的存储,在更快的硅片上,价格相同。对计划内容的任何更改都将单独公告,并附有自己的理由,因为将规格变更捆绑到硬件迁移中会让客户失去对迁移通知的信任。

随时恭候

选择城市,选择大小,用加密货币支付。

无需填写关于您的身份信息的表格,无需等待人工审批,无需电话验证。账单结清后,凭证将发送到您的邮箱。