Cosa c'è davvero nel rack
Due generazioni di CPU, nessuna terza. Memoria che corregge i propri errori sulla linea dove conta, NVMe enterprise in coppie mirrorate con un disco di riserva inattivo accanto, e tre giorni di burn-in prima che un nodo possa incontrare un cliente.
Due generazioni, e niente di più vecchio
La maggior parte degli host esegue tre o quattro generazioni contemporaneamente e le vende allo stesso prezzo, motivo per cui due server con specifiche identiche possono differire del quaranta percento sullo stesso carico di lavoro. Noi invece manteniamo la flotta ristretta.
Nulla in produzione è più vecchio di una generazione rispetto all'attuale. Questa regola vale dal 2022.
Ryzen 9 9950X, Zen 5
16 core, 32 thread, boost fino a 5,7 GHz. Questo è il thread singolo più veloce che possiamo acquistare, e la velocità del thread singolo è ancora ciò che determina la rapidità con cui una richiesta viene completata nella maggior parte delle applicazioni reali.
EPYC 9354P, Zen 4
32 core e 64 thread su un solo socket, dodici canali di memoria, ECC registrato. Dove il numero di core, la capacità di memoria e il comportamento NUMA prevedibile contano più del clock di picco, questo è il componente che vince.
Un solo socket dove possibile
L'accesso alla memoria tra socket è un dirupo di latenza da cui non puoi uscire ottimizzando. Solo la più grande configurazione bare-metal è dual socket, ed è dual socket perché il cliente ha esplicitamente chiesto 64 core.
I core sono allocati una volta sola
Un core venduto a te è pianificato per te. Nessun credito burst, nessun rapporto di oversubscription, nessun tempo di furto che appare sotto carico e scompare prima che tu possa fare uno screenshot.
Perché non il silicio server più recente
I componenti server Zen 5 sono in laboratorio e non nella flotta. Quando sostituiranno il 9354P apparirà nel changelog con le date di migrazione, piuttosto che come una frase in prima pagina sei mesi prima che qualcuno possa acquistarli.
Memoria, e dove vive realmente l'ECC
Gli errori di memoria non sono rari; sono solo invisibili finché qualcosa di importante non diventa sottilmente sbagliato. Sulla linea server, ognuno di essi viene corretto e registrato.
I nodi EPYC portano dodici moduli ECC registrati DDR5-4800, uno per canale, tutti popolati. Popolare ogni canale non riguarda la capacità, ma la larghezza di banda: un bus di memoria mezzo pieno su una parte a 32 core è un collo di bottiglia che sentirai su qualsiasi cosa tocchi la RAM in fretta.
I nodi Ryzen eseguono DDR5-5600 senza ECC, perché la piattaforma consumer non lo offre in una forma su cui faremmo affidamento. Questo è dichiarato chiaramente qui piuttosto che nascosto: se il tuo carico di lavoro ha bisogno di correzione degli errori, la linea EPYC parte da ottantanove euro ed esiste esattamente per questo motivo.
Gli errori correggibili vengono contati
Un rank che produce più di una manciata di correzioni in un giorno viene segnalato, e il modulo viene sostituito alla finestra di manutenzione successiva, che qualcosa si sia comportato male o no.
Gli errori non correggibili scaricano il nodo
Le istanze migrano, il nodo lascia il pool e il DIMM viene sostituito prima che ritorni. Potresti vedere una migrazione live; non dovresti vedere un crash.
Niente ballooning, niente merging di pagine
La memoria viene allocata una volta e non contata due volte. Il same-page merging è disattivato in tutta la flotta, perché è un canale laterale tra tenant e un'asserzione di prestazioni che evapora sotto carico reale.
La capacità per nodo è generosa apposta
Un nodo EPYC viene fornito con memoria sufficiente affinché il piano più grande che ospita lasci ancora margine. I nodi pieni fino all'ultimo gigabyte non hanno dove mettere una migrazione quando un vicino si deve spostare.
NVMe, resistenza e lo spare che non fa nulla
Ogni drive è una parte enterprise Gen4 con protezione da perdita di alimentazione, ovvero un banco di condensatori che completa la scrittura di ciò che ha riconosciuto quando l'alimentazione va via a metà flush.
Uno spare a caldo per nodo, inattivo, in attesa. È l'assicurazione più economica dell'edificio.
Coppie in mirror, sempre
Le letture sono distribuite su entrambe le metà; le scritture sono riconosciute dalla cache protetta e atterrano su entrambe. Un singolo guasto del drive cambia leggermente il profilo delle prestazioni e non cambia affatto la tua disponibilità.
Uno spare a caldo per nodo
Un drive per nodo resta inattivo e vuoto. Quando un mirror perde una metà, lo spare subentra automaticamente e la ricostruzione inizia prima che qualcuno abbia letto l'allarme.
Margine di resistenza, non limite di resistenza
I nodi generali usano drive di classe 1 DWPD; i nodi di storage usano 3 DWPD per il tier di scrittura. I drive vengono sostituiti all'ottanta percento della resistenza nominale, invece di essere portati al numero sul datasheet.
Nessun drive consumer da nessuna parte
Non nel tier di cache, non nel tier di massa, non in un nodo costruito in fretta da qualcuno nel 2021 e poi dimenticato. L'NVMe consumer è veloce per undici secondi e poi non lo è più, il che è un buon compromesso in un laptop.
La capacità è allocata, non promessa
Lo storage non è thin-provisioned tra i tenant. Se il piano dice 800 GB, 800 GB esistono su quel nodo con il tuo nome sopra, e nessun altro può crescere in quello spazio.
Cosa c'è in ogni classe di nodo
Cinque classi di nodi portano le cinque linee di prodotto. Lo storage di massa sulla classe S è SATA enterprise dietro un tier di scrittura NVMe, che è l'unico supporto rotante in tutta la flotta.
| Classe | CPU | Memoria | NVMe | Rete | Alimentazione |
|---|---|---|---|---|---|
| R — Ryzen NVMe | Ryzen 9 9950X, 16C/32T | 128 GB DDR5-5600 | 2 × 3.84 TB mirrorati, 1 spare | 2 × 10 GbE, LACP | 2 × 800 W, A e B |
| E — EPYC High-Memory | EPYC 9354P, 32C/64T | 12 × DDR5-4800 ECC RDIMM | 4 × 3.84 TB mirrorati, 1 spare | 2 × 25 GbE, LACP | 2 × 1200 W, A e B |
| G — GPU | EPYC 9354P, 32C/64T | 256 GB ECC DDR5-4800 | 4 × 3.84 TB mirrorati, 1 spare | 2 × 40 GbE, LACP | 2 × 2000 W, A e B |
| S — Storage | EPYC 9354P, 32C/64T | 128 GB ECC DDR5-4800 | 2 × 3.84 TB tier di scrittura, SATA di massa dietro | 2 × 25 GbE, LACP | 2 × 1200 W, A e B |
| BM — Bare Metal | Ryzen 9950X, oppure uno o due EPYC 9354P | 128 GB a 1 TB | Fino a 8 × 7.68 TB | 10 a 40 GbE | 2 × 1200 W, A e B |
I nodi GPU passano intere schede fisiche su PCIe 4.0 x16 senza time-slicing, ed è per questo che il valore di alimentazione è quello che è. Due schede in una stessa istanza giacciono sullo stesso nodo NUMA, perché dividerle tra socket costerebbe più di quanto guadagna la seconda scheda.
Alimentazione, e gestione che non è su internet
Due di tutto ciò che può essere raddoppiato, e una rete di gestione che non ha mai avuto una rotta verso il mondo esterno.
Alimentazioni A e B, percorsi separati
Due alimentatori per nodo su distribuzione indipendente, ciascuno dimensionato per sostenere da solo l'intera macchina. Perdere un'alimentazione è un evento registrato e nient'altro, e lo dimostriamo su ogni nodo durante il burn-in.
Batteria, poi generatore
La batteria copre il trasferimento; i generatori coprono il resto. Il trasferimento viene testato secondo un programma in ogni sito, e un sito che fallisce un test non riceve nuovi nodi finché non ne supera uno.
No tier number quoted
Le valutazioni appartengono agli edifici e agli operatori che le hanno commissionate, non a un cliente che ripete un numero in un testo di marketing. Quello che ti diremo, per ogni sito, è la topologia di alimentazione e il risultato dell'ultimo test di trasferimento.
Out-of-band sulla propria VLAN
Le interfacce di gestione non hanno route pubblica e non l'hanno mai avuta. L'accesso avviene tramite tunnel autenticato, viene registrato ed è disponibile sia a te che a noi.
Console inclusa, senza costi aggiuntivi
Seriale e VNC sulla tua istanza attraverso quel tunnel. Funziona quando la tua configurazione di rete non funziona, che è l'unico momento in cui qualcuno la desidera.
IPMI sui server dedicati, credenziali per periodo
I clienti bare-metal ricevono IPMI tramite VPN con controllo dell'alimentazione, ordine di boot e supporti virtuali. Le credenziali vengono ruotate alla fine di ogni periodo e il firmware del controller viene aggiornato secondo la nostra pianificazione, non la tua.
Burn-in: tre giorni prima che incontri un cliente
Circa un nodo su nove fallisce qualcosa al primo passaggio. Quasi sempre è un singolo modulo DIMM.
- 01
Firmware a una baseline nota
Il firmware di sistema, controller, rete e drive viene fissato alle versioni che la flotta esegue prima che qualsiasi test possa iniziare. Un nodo testato con il firmware sbagliato non ha testato nulla di utile.
- 02
Memoria, per lungo tempo
Più passaggi completi su ogni modulo popolato, ore piuttosto che minuti. Questa fase cattura la maggior parte di ciò che il burn-in cattura, ed è il motivo per cui la pianificazione è misurata in giorni.
- 03
Soak termico
Ogni core a pieno carico per sei ore con l'ingresso all'estremità calda del suo intervallo. Osserviamo il decadimento dei boost clock sostenuti, non solo la temperatura, perché un nodo che strozza termicamente alla quinta ora lo farebbe a te al terzo mese.
- 04
Verifica completa della superficie di storage
Ogni drive viene scritto da un capo all'altro, riletto e confrontato. I contatori SMART alla fine di questa fase diventano la baseline rispetto alla quale il drive viene giudicato per il resto della sua vita.
- 05
Velocità di linea, in entrambe le direzioni contemporaneamente
Ogni porta portata alla massima capacità in entrambe le direzioni per un'ora, con i contatori lato switch controllati per errori che l'host non noterebbe mai.
- 06
Stacca un feed, poi l'altro
Un feed rimosso, ripristinato, poi lo stesso sull'altro lato. Qualsiasi nodo che battere ciglio non entra in servizio.
- 07
Un giorno tranquillo nella flotta
Ventiquattro ore in monitoraggio senza trasportare alcuna istanza. Poi inizia a ospitare clienti.
Il tempo totale trascorso è di circa 72 ore. È anche il motivo per cui lo stock in un nuovo sito appare in lotti piuttosto che gocciolando: arriva un rack e tre giorni dopo tutto è disponibile in una volta.
Quando un drive inizia a guastarsi
I drive di solito non muoiono all'improvviso. Lo annunciano per giorni con contatori che nessuno legge, ed è per questo che i nostri vengono letti ogni cinque minuti.
- 01
Soglie, non elogi funebri
Errori di supporto, settori riallocati, livello di usura e outlier di latenza vengono campionati continuamente. Un drive che supera qualsiasi soglia viene segnalato per la sostituzione mentre funziona ancora perfettamente.
- 02
Lo spare subentra per primo
Lo spare a caldo viene portato nel mirror prima che il drive segnalato venga rimosso, così la coppia non funziona mai come copia singola mentre qualcuno aspetta un tecnico.
- 03
Rebuild, limitato di proposito
Un mirror da 3,84 TB potrebbe ricostruirsi in circa quaranta minuti a piena velocità. Lo eseguiamo più lentamente, in circa due ore, perché ricostruire a piena velocità è indistinguibile da un incidente di prestazioni per le istanze su quel nodo.
- 04
Vieni informato, e nient'altro cambia
Appare una nota sulla pagina dell'istanza. Nessun riavvio, nessuna migrazione, nessuna finestra di manutenzione e nessun ticket a cui devi rispondere.
- 05
Il disco esce a pezzi
I dischi guasti e ritirati vengono distrutti in sede piuttosto che restituiti per il credito di garanzia. Il credito vale meno della certezza.
Un mirror è ridondanza, non un backup. Ti protegge da un disco, non da una migrazione sbagliata o da una cancellazione entusiasta. Gli snapshot costano cinque euro per cinque slot e il backup off-node nove euro per 500 GB, scritto in un sito diverso dall'istanza.
Domande sull'hardware
No. I nodi Ryzen montano DDR5-5600 non ECC, e preferiamo dirlo qui piuttosto che lasciarti scoprire da un datasheet più tardi. Qualsiasi cosa per cui la corruzione silenziosa della memoria sia inaccettabile appartiene a EPYC.
Sì, ed è verificabile. Esegui un benchmark single-core sostenuto alle tre di notte e di nuovo in fascia di picco; i numeri non dovrebbero muoversi. Se lo fanno, apri un ticket, perché qualcosa non va e vorremmo saperlo.
Non per nome, ma puoi chiedere l'anti-affinità: due tue istanze piazzate su nodi separati, switch separati e alimentazioni separate. Non costa nulla e richiede un ticket.
Dove il lavoro lo consente, le istanze migrano a caldo e vedi qualche centinaio di millisecondi di pausa. Altrimenti ricevi almeno cinque giorni di preavviso, con una finestra che puoi spostare una volta se il tempismo non va bene per te.
No. Core, memoria e NVMe sono allocati una volta ciascuno. L'unica risorsa condivisa è l'uplink, motivo per cui la cifra di fair use è pubblicata piuttosto che implicita.
Ogni nodo in produzione esegue Zen 4 o Zen 5. L'ultimo della generazione precedente ha lasciato la flotta nel 2022, e nulla è stato venduto su silicio più vecchio da allora.
Stesso hardware, trentaquattro città
La specifica del nodo non cambia con la bandiera sull'edificio. Scegli la giurisdizione e la latenza che vuoi, poi scegli la dimensione.