O que realmente está no rack
Duas gerações de CPU, sem terceira. Memória que corrige seus próprios erros na linha onde isso importa, NVMe empresarial em pares espelhados com um spare ocioso ao lado, e três dias de burn-in antes que um nó possa conhecer um cliente.
Duas gerações, e nada mais antigo
A maioria dos hosts opera três ou quatro gerações ao mesmo tempo e as vende pelo mesmo preço, e é por isso que dois servidores com especificações idênticas podem diferir em quarenta por cento na mesma carga de trabalho. Nós mantemos a frota estreita.
Nada em produção está a mais de uma geração atrás do atual. Essa regra vale desde 2022.
Ryzen 9 9950X, Zen 5
16 núcleos, 32 threads, com boost de até 5,7 GHz. Este é o single-thread mais rápido que podemos comprar, e a velocidade de single-thread ainda é o que decide a rapidez com que uma requisição termina na maioria dos aplicativos reais.
EPYC 9354P, Zen 4
32 núcleos e 64 threads em um único soquete, doze canais de memória, ECC registrado. Onde a contagem de núcleos, a capacidade de memória e o comportamento previsível de NUMA importam mais do que o clock máximo, esta é a peça que vence.
Um soquete sempre que possível
O acesso à memória entre soquetes é um precipício de latência do qual você não consegue sair com ajustes. Somente a maior configuração bare-metal usa dois soquetes, e usa dois soquetes porque o cliente pediu explicitamente por 64 núcleos.
Núcleos são alocados uma única vez
Um núcleo vendido a você é agendado para você. Sem créditos de rajada, sem taxa de oversubscription, sem tempo de roubo que aparece sob carga e desaparece antes que você possa tirar um print.
Por que não os processadores de servidor mais novos
As peças de servidor Zen 5 estão no laboratório e não na frota. Quando substituírem o 9354P, isso aparecerá no changelog com datas de migração, em vez de uma frase na página inicial seis meses antes de alguém poder comprar.
Memória, e onde o ECC realmente mora
Erros de memória não são raros; eles são apenas invisíveis até que algo importante fique sutilmente errado. Na linha de servidores, cada um deles é corrigido e registrado.
Os nós EPYC carregam doze módulos DDR5-4800 ECC registrados, um por canal, todos preenchidos. Preencher todos os canais não é sobre capacidade, é sobre largura de banda: um barramento de memória meio cheio em uma peça de 32 núcleos é um gargalo que você sentirá em qualquer coisa que acesse RAM rapidamente.
Os nós Ryzen rodam DDR5-5600 sem ECC, porque a plataforma de consumo não oferece isso em uma forma em que possamos confiar. Isso é declarado aqui claramente em vez de enterrado: se sua carga de trabalho precisa de correção de erros, a linha EPYC começa em oitenta e nove euros e existe exatamente para esse motivo.
Erros corrigíveis são contados
Um rank que produza mais de um punhado de correções em um dia é sinalizado, e o módulo é trocado na próxima janela de manutenção, tenha ou não algo se comportado mal.
Erros não corrigíveis drenam o nó
As instâncias migram para fora, o nó sai do pool e o DIMM é substituído antes de voltar. Você pode ver uma migração ao vivo; você não deve ver um crash.
Sem ballooning, sem merge de páginas
A memória é alocada uma vez e não contada duas vezes. O same-page merging está desligado em toda a frota, porque é um canal lateral entre tenants e uma afirmação de desempenho que evapora sob carga real.
A capacidade por nó é generosa de propósito
Um nó EPYC vem com memória suficiente para que o maior plano que ele hospeda ainda deixe folga. Nós cheios até o último gigabyte não têm onde colocar uma migração quando um vizinho precisa se mover.
NVMe, resistência e o spare que não faz nada
Cada drive é uma peça Gen4 empresarial com proteção contra perda de energia, que é um banco de capacitores que termina de escrever o que foi confirmado quando a energia acaba no meio do flush.
Um hot spare por nó, ocioso, esperando. É o seguro mais barato do prédio.
Pares espelhados, sempre
As leituras são distribuídas entre as duas metades; as escritas são confirmadas a partir do cache protegido e chegam a ambas. Uma falha única de drive muda o perfil de desempenho ligeiramente e não muda sua disponibilidade em nada.
Um hot spare por nó
Um disco por nó fica ocioso e vazio. Quando um espelho perde uma metade, o reserva assume automaticamente e a reconstrução começa antes que alguém leia o alerta.
Folga de resistência, não limite de resistência
Os nós gerais usam unidades classe 1 DWPD; os nós de armazenamento usam 3 DWPD para a camada de escrita. As unidades são substituídas a oitenta por cento da durabilidade nominal, em vez de serem levadas até o número na folha de dados.
Nenhuma unidade de consumo em lugar algum
Nem na camada de cache, nem na camada de volume, nem em um nó que alguém montou rapidamente em 2021 e esqueceu. NVMe de consumo é rápida por onze segundos e depois não é, o que é uma boa troca em um laptop.
Capacidade é alocada, não prometida
O armazenamento não é thin-provisioned entre locatários. Se o plano diz 800 GB, existem 800 GB naquele nó com seu nome, e ninguém mais pode crescer para dentro deles.
O que há em cada classe de nó
Cinco classes de nós carregam as cinco linhas de produtos. Armazenamento em massa na classe S é SATA empresarial atrás de uma camada de gravação NVMe, que é a única mídia rotativa em toda a frota.
| Classe | CPU | Memória | NVMe | Rede | Alimentação |
|---|---|---|---|---|---|
| R — Ryzen NVMe | Ryzen 9 9950X, 16C/32T | 128 GB DDR5-5600 | 2 × 3.84 TB espelhados, 1 reserva | 2 × 10 GbE, LACP | 2 × 800 W, A e B |
| E — EPYC Alta Memória | EPYC 9354P, 32C/64T | 12 × DDR5-4800 ECC RDIMM | 4 × 3.84 TB espelhados, 1 reserva | 2 × 25 GbE, LACP | 2 × 1200 W, A e B |
| G — GPU | EPYC 9354P, 32C/64T | 256 GB ECC DDR5-4800 | 4 × 3.84 TB espelhados, 1 reserva | 2 × 40 GbE, LACP | 2 × 2000 W, A e B |
| S — Armazenamento | EPYC 9354P, 32C/64T | 128 GB ECC DDR5-4800 | 2 × 3.84 TB camada de gravação, SATA em massa atrás | 2 × 25 GbE, LACP | 2 × 1200 W, A e B |
| BM — Bare Metal | Ryzen 9950X, ou um ou dois EPYC 9354P | 128 GB a 1 TB | Até 8 × 7.68 TB | 10 a 40 GbE | 2 × 1200 W, A e B |
Nós GPU passam placas físicas inteiras por PCIe 4.0 x16 sem divisão de tempo, que é o porquê do valor de energia ser o que é. Duas placas em uma única instância ficam no mesmo nó NUMA, porque dividi-las entre soquetes custaria mais do que a segunda placa ganha.
Alimentação elétrica, e gerenciamento que não está na internet
Dois de tudo que pode ser duplicado, e uma rede de gerenciamento que nunca teve rota para o mundo exterior.
Alimentações A e B, caminhos separados
Duas fontes por nó em distribuição independente, cada uma dimensionada para carregar a máquina inteira sozinha. Perder uma alimentação é um evento registrado e nada mais, e provamos isso em todos os nós durante o burn-in.
Bateria, depois gerador
A bateria cobre a transferência; os geradores cobrem o resto. A transferência é testada em um cronograma em todos os sites, e um site que falha em um teste não recebe novos nós até passar em um.
Sem número de tier citado
As classificações pertencem aos edifícios e aos operadores que as solicitaram, não a um locatário que repete um número em material de marketing. O que diremos a você, por site, é a topologia de alimentação e o resultado do último teste de transferência.
Fora da banda em VLAN própria
As interfaces de gerenciamento não têm rota pública e nunca tiveram. O acesso se dá por um túnel autenticado, é registrado e está disponível para você e para nós.
Console incluído, sem custo
Serial e VNC para sua instância através desse túnel. Funciona quando sua configuração de rede não funciona, que é o único momento em que alguém quer isso.
IPMI em metal, credenciais por período
Clientes de bare metal recebem IPMI via VPN com controle de energia, ordem de boot e mídia virtual. As credenciais são rotacionadas quando um período termina, e o firmware do controlador é atualizado em nossa programação, não na sua.
Burn-in: três dias antes de encontrar um cliente
Cerca de um em cada nove nós falha em algo na primeira passagem. Quase sempre é um único DIMM.
- 01
Firmware para uma linha de base conhecida
O firmware do sistema, controlador, rede e unidade é fixado nas versões que a frota executa antes que qualquer teste possa começar. Um nó testado com firmware errado não testou nada útil.
- 02
Memória, longamente
Múltiplas passagens completas em cada módulo populado, horas em vez de minutos. Esta etapa captura a maior parte do que o burn-in captura, e é a razão pela qual o cronograma é medido em dias.
- 03
Soak térmico
Cada núcleo em carga total por seis horas com a entrada de ar no extremo quente de sua faixa. Observamos a degradação dos clocks sustentados, não apenas a temperatura, porque um nó que faz throttle térmico na hora cinco faria com você no mês três.
- 04
Verificação de armazenamento de superfície completa
Cada unidade gravada de ponta a ponta, lida de volta e comparada. Os contadores SMART ao final desta etapa tornam-se a linha de base contra a qual a unidade é julgada pelo resto de sua vida.
- 05
Taxa de linha, ambas as direções ao mesmo tempo
Cada porta levada à capacidade em ambas as direções por uma hora, com contadores do lado do switch verificados para erros que o host nunca notaria.
- 06
Remova um feed, depois o outro
Um feed removido, restaurado e depois o mesmo no outro lado. Qualquer nó que pisque não entra em serviço.
- 07
Um dia tranquilo na frota
Vinte e quatro horas em monitoramento sem carregar nenhuma instância. Então começa a receber clientes.
O tempo total decorrido é de cerca de 72 horas. É também por isso que o estoque em um novo site aparece em lotes em vez de gotejar: um rack chega e, três dias depois, tudo está disponível de uma vez.
Quando uma unidade começa a falhar
As unidades geralmente não morrem de repente. Elas anunciam por dias em contadores que ninguém lê, e é por isso que os nossos são lidos a cada cinco minutos.
- 01
Limiares, não elogios fúnebres
Erros de mídia, setores realocados, nível de desgaste e outliers de latência são amostrados continuamente. Uma unidade que cruza qualquer limiar é marcada para substituição enquanto ainda está funcionando perfeitamente.
- 02
O sobressalente assume primeiro
O sobressalente quente é trazido para o espelho antes que a unidade marcada seja removida, para que o par nunca fique como uma cópia única enquanto alguém espera por um técnico.
- 03
Rebuild, limitado de propósito
Um espelho de 3,84 TB poderia ser reconstruído em cerca de quarenta minutos em velocidade total. Nós o executamos mais devagar, em cerca de duas horas, porque reconstruir em velocidade total é indistinguível de um incidente de desempenho para as instâncias nesse nó.
- 04
Você é informado, e nada mais muda
Uma nota aparece na página da instância. Sem reboot, sem migração, sem janela de manutenção e sem ticket que você precise responder.
- 05
O drive sai em pedaços
Drives com falha e aposentados são destruídos no local, em vez de serem devolvidos para crédito de garantia. O crédito vale menos do que a certeza.
Um espelho é redundância, não um backup. Ele protege você de um drive, não de uma migração ruim ou de um delete entusiasmado. Snapshots custam cinco euros por cinco slots e backup fora do nó, nove euros por 500 GB, gravados em um site diferente da instância.
Perguntas sobre hardware
Não. Os nós Ryzen usam DDR5-5600 não-ECC, e preferimos dizer isso aqui do que deixar você descobrir em uma folha de dados depois. Qualquer coisa onde corrupção silenciosa de memória seja inaceitável pertence ao EPYC.
Sim, e isso é verificável. Rode um benchmark de núcleo único sustentado às três da manhã e novamente no pico; os números não devem se mover. Se moverem, abra um ticket, porque algo está errado e gostaríamos de saber.
Não pelo nome, mas você pode pedir anti-afinidade: duas instâncias suas colocadas em nós separados, switches separados e alimentações separadas. Isso não custa nada e leva um ticket.
Onde o trabalho permitir, as instâncias são migradas ao vivo e você vê alguns poucos milissegundos de pausa. Caso contrário, você recebe pelo menos cinco dias de aviso, com uma janela que você pode mover uma vez se o horário não for bom para você.
Não. Núcleos, memória e NVMe são alocados uma vez cada. O único recurso compartilhado é o uplink, que é por isso que o número de uso justo é publicado em vez de implícito.
Cada nó em produção roda Zen 4 ou Zen 5. O último da geração anterior saiu da frota em 2022, e nada foi vendido em silício mais antigo desde então.
Mesmo hardware, trinta e quatro cidades
A especificação do nó não muda com a bandeira no prédio. Escolha a jurisdição e a latência que você quer, e então escolha o tamanho.