Tenue depuis octobre 2019

Migration de toute la flotte vers Zen 4

Chaque nœud de production passe à du silicium EPYC ou Ryzen de dernière génération au cours des neuf prochains mois, un nœud à la fois, avec des fenêtres annoncées et aucun redémarrage silencieux.

À partir de janvier, chaque nœud de la flotte passe à la génération actuelle de silicium : la série EPYC 9004 sur les lignes serveur et stockage, la série Ryzen 7000 sur la ligne générale. Le plan s'étend sur environ neuf mois. Rien de plus ancien que la génération actuelle ne prendra en charge les charges de travail des clients d'ici la fin.

C'est la plus grande opération que nous ayons jamais effectuée sur la flotte en production, et il vaut mieux l'expliquer avant qu'elle ne commence plutôt qu'après.

Pourquoi maintenant

La flotte existante est un mélange de deux générations précédentes, ce qui était défendable en 2020 et a cessé de l'être vers l'année dernière. Trois choses ont changé à la fois : la DDR5 avec ECC est devenue disponible dans les capacités nécessaires à la ligne serveur, la bande passante mémoire par socket a augmenté suffisamment pour importer pour les clients limités par la mémoire, et les performances par cœur des anciens processeurs ont cessé d'être quelque chose que nous voulions afficher à côté d'un prix.

Il y a aussi une raison plus terre à terre. Une flotte qui comprend trois générations nécessite trois jeux de pièces de rechange, trois procédures de qualification et trois ensembles de firmware à suivre. La consolidation à une seule génération élimine toute une catégorie de surprises à deux heures du matin.

L'ordre

Amsterdam d'abord, parce que tout est expédié à AMS-01 en premier et l'a toujours été. Francfort, Londres et New York suivent, puis les autres sites européens, puis l'Asie-Pacifique, puis les Amériques. Environ quatorze nœuds par semaine une fois le processus stabilisé, moins au début pendant que nous découvrons ce que nous avons mal fait.

Les sites qui ouvrent pendant la migration ouvrent directement sur la nouvelle génération et ne voient jamais l'ancienne.

Ce que vous vivrez

Migration à chaud là où la charge de travail le permet. La plupart des instances sont déplacées entre les hôtes avec une pause mesurée en centaines de millisecondes. Vous le verrez dans un graphique si vous regardez, et pas autrement.

Un redémarrage planifié là où ce n'est pas le cas. Les instances utilisant le GPU passthrough, des noyaux personnalisés avec des périphériques épinglés, ou tout ce qui maintient l'état matériel ne peuvent pas être déplacées à chaud. Celles-ci reçoivent une fenêtre.

Cinq jours ouvrables de préavis, par e-mail, avec une fenêtre précise. Pas un mois de vague. Si nous manquons une fenêtre annoncée, le crédit SLA s'applique automatiquement sans que personne ait à ouvrir un ticket à ce sujet.

Pas de changement de prix. La nouvelle génération coûte le même prix que l'ancienne. Nous ne vendons pas de supplément pour la génération et nous ne gardons pas l'ancien matériel à prix réduit pour les clients qui n'ont pas lu l'e-mail. Il quitte le bâtiment.

La seule chose à vérifier

L'ensemble de fonctionnalités du CPU change, et AVX-512 est présent sur les nouveaux processeurs serveur là où il ne l'était pas auparavant. Compilez avec la détection de fonctionnalités et rien ne se passe. Si vous avez épinglé une build à un ensemble de drapeaux spécifique, ou si vous exécutez du code numérique qui se distribue sur les fonctionnalités détectées au démarrage, testez avant votre fenêtre plutôt qu'après.

Nous listerons les différences exactes de drapeaux dans l'avis de migration pour votre site. Environ un client sur deux cents a besoin de faire quoi que ce soit, et ceux qui en ont besoin savent déjà qui ils sont.

Ce qui a déjà mal tourné

Un lot de modules DDR5 ECC enregistrés pour les quatre premiers nœuds serveur s'est entraîné à une vitesse inférieure à celle spécifiée et il a fallu neuf jours pour déterminer que les modules, et non les cartes, étaient en cause. Ces neuf jours sont la raison pour laquelle cette annonce est faite en décembre plutôt qu'en octobre.

L'approvisionnement est le risque de tout le plan. La mémoire serveur dans ces capacités n'est pas quelque chose que l'on peut se procurer rapidement, et si le calendrier glisse, ce sera à cause de la mémoire plutôt qu'à cause de quelque chose que nous contrôlons. Nous le dirons ici si c'est le cas.

Ce que nous ne faisons pas

Nous n'offrons pas de possibilité de refus. Une flotte avec une longue traîne de clients qui ont refusé de déménager est une flotte avec une ancienne génération pour toujours, et la traîne devient ce que personne ne veut maintenir. Tout bouge.

Nous ne saisissons pas non plus l'occasion de modifier les spécifications des plans. Les mêmes cœurs, la même mémoire, le même stockage, sur du silicium plus rapide, au même prix. Tout changement de ce que contient un plan fera l'objet d'une annonce séparée avec son propre raisonnement, car regrouper un changement de spécification dans une migration matérielle est la façon de faire perdre confiance aux clients envers les avis de migration.

Prêt quand vous l'êtes

Choisissez une ville. Choisissez une taille. Payez en crypto.

Aucun formulaire sur votre identité, pas d'attente d'approbation humaine, pas d'appel téléphonique pour vérifier quoi que ce soit. La facture est réglée et les identifiants arrivent dans votre boîte mail.