Ab Januar läuft jeder Node der Flotte auf Silizium der aktuellen Generation: EPYC-9004-Serie bei den Server- und Storage-Linien, Ryzen-7000-Serie bei der allgemeinen Linie. Der Plan läuft etwa neun Monate. Nichts Älteres als die aktuelle Generation wird am Ende davon Kunden-Workloads tragen.
Das ist das Größte, was wir je mit der laufenden Flotte gemacht haben, und es verdient eine Erklärung, bevor es startet, nicht danach.
Warum jetzt
Die bestehende Flotte ist eine Mischung aus zwei vorherigen Generationen, was 2020 vertretbar war und irgendwann letztes Jahr aufgehört hat, vertretbar zu sein. Drei Dinge änderten sich gleichzeitig: DDR5 mit ECC wurde in den Kapazitäten verfügbar, die die Server-Linie braucht, die Speicherbandbreite pro Socket stieg genug an, um für die speichergebundenen Kunden relevant zu sein, und die Pro-Kern-Werte der älteren Teile waren nichts mehr, was wir neben einem Preis drucken wollten.
Es gibt auch einen langweiligeren Grund. Eine Flotte mit drei Generationen braucht drei Sätze Ersatzteile, drei Qualifikationsverfahren und drei Sätze Firmware, die es zu verfolgen gilt. Die Konsolidierung auf eine Generation beseitigt eine ganze Kategorie von Überraschungen um zwei Uhr nachts.
Die Reihenfolge
Zuerst Amsterdam, weil alles zuerst nach AMS-01 verschifft wird und das schon immer so war. Frankfurt, London und New York folgen, dann die übrigen europäischen Standorte, dann Asien-Pazifik, dann die Amerikas. Etwa vierzehn Nodes pro Woche, sobald sich der Prozess eingespielt hat, weniger am Anfang, während wir herausfinden, was wir falsch gemacht haben.
Standorte, die während der Migration eröffnet werden, gehen direkt auf der neuen Generation an den Start und sehen die alte nie.
Was Sie erleben werden
Live-Migration, wo der Workload es unterstützt. Die meisten Instanzen wechseln zwischen Hosts mit einer Pause, die in niedrigen Hunderten von Millisekunden gemessen wird. Sie sehen es in einem Graphen, wenn Sie schauen, sonst nicht.
Ein geplanter Neustart, wo das nicht der Fall ist. Instanzen mit GPU-Passthrough, benutzerdefinierten Kerneln mit gepinnten Geräten oder allem, was Hardwarezustand hält, können nicht live verschoben werden. Die bekommen ein Zeitfenster.
Fünf Werktage Vorlauf per E-Mail mit einem konkreten Zeitfenster. Kein Monat der Unverbindlichkeit. Wenn wir ein angekündigtes Fenster verpassen, wird die SLA-Gutschrift automatisch angewendet, ohne dass jemand ein Ticket dazu eröffnen muss.
Keine Preisänderung. Die neue Generation kostet dasselbe wie die alte. Wir verkaufen keinen Generationsaufpreis, und wir behalten die alte Hardware nicht zu einem Rabatt für Kunden, die die E-Mail nicht gelesen haben. Sie verlässt das Gebäude.
Die eine Sache, die es zu prüfen gilt
Der CPU-Funktionssatz ändert sich, und AVX-512 ist auf den neuen Server-Teilen vorhanden, wo es vorher nicht war. Kompilieren Sie mit Feature-Erkennung, und nichts passiert. Wenn Sie einen Build auf ein bestimmtes Flag-Set gepinnt haben oder Sie numerischen Code ausführen, der beim Start auf erkannte Features dispatcht, testen Sie vor Ihrem Fenster und nicht danach.
Wir listen die genauen Flag-Unterschiede in der Migrationsmitteilung für Ihren Standort auf. Etwa einer von zweihundert Kunden muss überhaupt etwas tun, und die, die es müssen, wissen bereits, wer sie sind.
Was bereits schiefgelaufen ist
Eine Charge registrierter ECC-DDR5-Module für die ersten vier Server-Nodes trainierte mit einer niedrigeren Geschwindigkeit als angegeben, und es dauerte neun Tage, um herauszufinden, dass die Module die Schuld trugen, nicht die Boards. Diese neun Tage sind der Grund, warum diese Ankündigung im Dezember statt im Oktober kommt.
Lieferung ist das Risiko für den gesamten Plan. Serverspeicher in diesen Kapazitäten ist nicht etwas, das Sie kurzfristig beschaffen können, und wenn der Zeitplan rutscht, wird es wegen des Speichers rutschen und nicht wegen etwas, das wir kontrollieren. Wir werden es hier sagen, falls das passiert.
Was wir nicht tun
Wir bieten kein Opt-out an. Eine Flotte mit einem langen Schwanz von Kunden, die den Umzug abgelehnt haben, ist eine Flotte mit einer alten Generation für immer, und der Schwanz wird zu dem Ding, das niemand warten will. Alles zieht um.
Wir nutzen auch nicht die Gelegenheit, Planspezifikationen zu ändern. Dieselben Cores, derselbe Speicher, derselbe Storage, auf schnellerem Silizium, zum gleichen Preis. Jede Änderung dessen, was ein Plan enthält, wird eine separate Ankündigung mit eigener Begründung sein, denn das Bündeln einer Spezifikationsänderung in eine Hardware-Migration ist, wie Kunden aufhören, Migrationsmitteilungen zu vertrauen.