A partir de janeiro, cada nó da frota migra para silício de geração atual: EPYC 9004 nas linhas de servidor e armazenamento, Ryzen 7000 na linha geral. O plano leva cerca de nove meses. Nada mais antigo que a geração atual estará executando cargas de trabalho de clientes ao final.
Esta é a maior ação que já realizamos na frota em operação, e vale a pena explicar antes de começar, e não depois.
Por que agora
A frota atual é uma mistura de duas gerações anteriores, o que era defensável em 2020 e deixou de ser em algum momento do ano passado. Três coisas mudaram ao mesmo tempo: DDR5 com ECC ficou disponível nas capacidades que a linha de servidores precisa, a largura de banda de memória por socket aumentou o suficiente para importar para clientes limitados por memória, e os números por núcleo das peças antigas deixaram de ser algo que queríamos imprimir ao lado de um preço.
Há também um motivo mais monótono. Uma frota com três gerações precisa de três conjuntos de peças sobressalentes, três procedimentos de qualificação e três conjuntos de firmware para rastrear. Consolidar em uma só elimina uma categoria inteira de surpresa às duas da manhã.
A ordem
Amsterdã primeiro, porque tudo chega a AMS-01 primeiro e sempre chegou. Frankfurt, Londres e Nova York em seguida, depois os demais sites europeus, depois Ásia-Pacífico, depois as Américas. Cerca de catorze nós por semana quando o processo se estabiliza, menos no início enquanto descobrimos o que erramos.
Sites abertos durante a migração abrem diretamente na nova geração e nunca veem a antiga.
O que você vai experimentar
Migração ao vivo onde a carga de trabalho suporta. A maioria das instâncias se move entre hosts com uma pausa medida em centenas de milissegundos. Você verá isso em um gráfico se estiver olhando, e não de outra forma.
Uma reinicialização agendada onde não suporta. Instâncias que usam passagem de GPU, kernels customizados com dispositivos fixados, ou qualquer coisa que mantenha estado de hardware não podem ser movidas ao vivo. Essas ganham uma janela.
Aviso de cinco dias úteis, por e-mail, com uma janela específica. Não um mês de vagueza. Se perdermos uma janela anunciada, o crédito do SLA se aplica automaticamente sem que ninguém precise abrir um ticket sobre isso.
Sem mudança de preço. A nova geração custa o mesmo que a antiga. Não vendemos sobretaxa de geração e não mantemos o hardware antigo com desconto para clientes que não leram o e-mail. Ele sai do prédio.
A única coisa para verificar
O conjunto de recursos da CPU muda, e AVX-512 está presente nas novas peças de servidor onde não estava antes. Compile com detecção de recursos e nada acontece. Se você fixou uma compilação a um conjunto específico de flags, ou executa código numérico que despacha com base em recursos detectados na inicialização, teste antes da sua janela, não depois.
Listaremos as diferenças exatas de flags no aviso de migração do seu site. Cerca de um cliente em duzentos precisa fazer qualquer coisa, e os que precisam já sabem quem são.
O que já deu errado
Um lote de módulos DDR5 ECC registrados para os três primeiros nós de servidor treinou a uma velocidade menor que a especificada, e levamos nove dias para descobrir que os módulos, não as placas, eram os culpados. Esses nove dias são o motivo deste anúncio ser em dezembro em vez de outubro.
Fornecimento é o risco de todo o plano. Memória de servidor nessas capacidades não é algo que você consegue em curto prazo, e se o cronograma atrasar, será por causa da memória, não por algo que controlamos. Diremos isso aqui se acontecer.
O que não estamos fazendo
Não estamos oferecendo opção de saída. Uma frota com uma cauda longa de clientes que recusaram migrar é uma frota com uma geração antiga para sempre, e a cauda se torna aquilo que ninguém quer manter. Tudo migra.
Também não estamos aproveitando a oportunidade para mudar as especificações dos planos. Os mesmos núcleos, a mesma memória, o mesmo armazenamento, em silício mais rápido, pelo mesmo preço. Qualquer mudança no que um plano contém será um anúncio separado com sua própria justificativa, porque embutir uma mudança de especificação em uma migração de hardware é como os clientes deixam de confiar em avisos de migração.