Co faktycznie jest w szafie
Dwie generacje CPU, żadnej trzeciej. Pamięć, która koryguje własne błędy w miejscach, gdzie to ma znaczenie, korporacyjne NVMe w lustrzanych parach z zapasem, który czeka bezczynnie obok, i trzy dni burn-in, zanim węzeł zostanie dopuszczony do kontaktu z klientem.
Dwie generacje, i nic starszego
Większość hostów trzyma trzy lub cztery generacje naraz i sprzedaje je w tej samej cenie, dlatego dwa serwery o identycznej specyfikacji mogą różnić się o czterdzieści procent w tym samym obciążeniu. My zamiast tego utrzymujemy wąską flotę.
Nic w produkcji nie jest starsze niż jedna generacja w stosunku do obecnej. Ta zasada obowiązuje od 2022 roku.
Ryzen 9 9950X, Zen 5
16 rdzeni, 32 wątki, taktowanie boost do 5,7 GHz. To najszybszy pojedynczy wątek, jaki możemy kupić, a szybkość pojedynczego wątku wciąż decyduje o tym, jak szybko kończy się żądanie w większości rzeczywistych aplikacji.
EPYC 9354P, Zen 4
32 rdzenie i 64 wątki na jednym gnieździe, dwanaście kanałów pamięci, rejestrowany ECC. Tam, gdzie liczba rdzeni, pojemność pamięci i przewidywalne zachowanie NUMA są ważniejsze niż szczytowe taktowanie, ta część wygrywa.
Jedno gniazdo gdziekolwiek to możliwe
Dostęp do pamięci między gniazdami to klif opóźnień, którego nie da się obejść strojeniem. Tylko największa konfiguracja bare metal jest dwugniazdowa, i jest dwugniazdowa, ponieważ klient wyraźnie poprosił o 64 rdzenie.
Rdzenie są przydzielane raz
Rdzeń sprzedany Tobie jest planowany dla Ciebie. Bez kredytów burst, bez współczynnika nadsubskrypcji, bez czasu steal pojawiającego się pod obciążeniem i znikającego, zanim zdążysz zrobić zrzut ekranu.
Dlaczego nie najnowsze krzem serwerowy
Części serwerowe Zen 5 są w laboratorium, a nie we flocie. Kiedy zastąpią 9354P, pojawi się to w dzienniku zmian z datami migracji, a nie jako fraza na stronie głównej na sześć miesięcy przed tym, zanim ktokolwiek będzie mógł je kupić.
Pamięć i gdzie faktycznie mieszka ECC
Błędy pamięci nie są rzadkie; są po prostu niewidoczne, dopóki coś ważnego nie stanie się subtelnie nie tak. W linii serwerowej każdy z nich jest korygowany i rejestrowany.
Węzły EPYC mają dwanaście modułów DDR5-4800 rejestrowanych ECC, jeden na kanał, wszystkie obsadzone. Obsadzenie każdego kanału nie chodzi o pojemność, ale o przepustowość: półpełna magistrala pamięci w części z 32 rdzeniami to wąskie gardło, które odczujesz na wszystkim, co szybko dotyka pamięci RAM.
Węzły Ryzen działają na DDR5-5600 bez ECC, ponieważ platforma konsumencka nie oferuje go w formie, na której moglibyśmy polegać. Jest to powiedziane wprost tutaj, a nie ukryte: jeśli Twoje obciążenie potrzebuje korekcji błędów, linia EPYC zaczyna się od osiemdziesięciu dziewięciu euro i istnieje właśnie z tego powodu.
Błędy korygowalne są liczone
Ranga wytwarzająca więcej niż kilka korekcji dziennie jest oznaczana, a moduł jest wymieniany podczas następnego okna konserwacyjnego, niezależnie od tego, czy coś zachowywało się nieprawidłowo.
Błędy niekorygowalne opróżniają węzeł
Instancje migrują z węzła, węzeł opuszcza pulę, a moduł DIMM jest wymieniany, zanim wróci. Możesz zobaczyć migrację na żywo; nie powinieneś zobaczyć awarii.
Brak balonowania, brak scalania stron
Pamięć jest przydzielana raz i nie jest liczona podwójnie. Scalanie tych samych stron jest wyłączone w całej flocie, ponieważ jest to kanał boczny między dzierżawcami i twierdzenie o wydajności, które znika pod prawdziwym obciążeniem.
Pojemność na węzeł jest celowo hojna
Węzeł EPYC ma wystarczająco dużo pamięci, aby największy plan, który hostuje, nadal pozostawiał zapas. Węzły zapakowane do ostatniego gigabajta nie mają gdzie umieścić migracji, gdy sąsiad musi się przenieść.
NVMe, trwałość i zapas, który nic nie robi
Każdy dysk to część klasy enterprise Gen4 z ochroną przed utratą zasilania, czyli bankiem kondensatorów, który kończy zapisywać to, co potwierdził, gdy zasilanie zanika w trakcie opróżniania bufora.
Gorący zapas na węźle, bezczynny, czekający. To najtańsze ubezpieczenie w budynku.
Lustrzane pary, zawsze
Odczyty są rozłożone na obie połowy; zapisy są potwierdzane z chronionej pamięci podręcznej i trafiają na obie. Pojedyncza awaria dysku nieznacznie zmienia profil wydajności i wcale nie zmienia Twojej dostępności.
Gorący zapas na węzeł
Jeden dysk w każdym węźle pozostaje bezczynny i pusty. Gdy mirror traci połowę, zapasowy dysk przejmuje automatycznie, a odbudowa zaczyna się, zanim ktokolwiek przeczyta alert.
Zapas trwałości, a nie limit trwałości
Węzły ogólne używają dysków klasy 1 DWPD; węzły magazynowe używają 3 DWPD dla warstwy zapisu. Dyski są wymieniane przy osiemdziesięciu procentach znamionowej wytrzymałości, zamiast dociskać je do liczby z karty katalogowej.
Nigdzie dysków konsumenckich
Nie w warstwie cache, nie w warstwie masowej, nie w węźle, który ktoś szybko zbudował w 2021 i zapomniał o nim. Konsumencki NVMe jest szybki przez jedenaście sekund, a potem już nie, co jest dobrym kompromisem w laptopie.
Pojemność jest przydzielana, nie obiecywana
Magazyn nie jest thin-provisioned między dzierżawcami. Jeśli plan mówi 800 GB, to 800 GB istnieje na tym węźle z Twoją nazwą i nikt inny nie może w to wrosnąć.
Co jest w każdej klasie węzła
Pięć klas węzłów obsługuje pięć linii produktów. Masowy magazyn w klasie S to enterprise SATA za warstwą zapisu NVMe, co jest jedynym nośnikiem wirującym w całej flocie.
| Klasa | CPU | Pamięć | NVMe | Sieć | Zasilanie |
|---|---|---|---|---|---|
| R — Ryzen NVMe | Ryzen 9 9950X, 16C/32T | 128 GB DDR5-5600 | 2 × 3,84 TB mirrored, 1 zapasowy | 2 × 10 GbE, LACP | 2 × 800 W, A i B |
| E — EPYC High-Memory | EPYC 9354P, 32C/64T | 12 × DDR5-4800 ECC RDIMM | 4 × 3,84 TB mirrored, 1 zapasowy | 2 × 25 GbE, LACP | 2 × 1200 W, A i B |
| G — GPU | EPYC 9354P, 32C/64T | 256 GB ECC DDR5-4800 | 4 × 3,84 TB mirrored, 1 zapasowy | 2 × 40 GbE, LACP | 2 × 2000 W, A i B |
| S — Storage | EPYC 9354P, 32C/64T | 128 GB ECC DDR5-4800 | 2 × 3,84 TB warstwa zapisu, za nią masowy SATA | 2 × 25 GbE, LACP | 2 × 1200 W, A i B |
| BM — Bare Metal | Ryzen 9950X lub jeden/dwa EPYC 9354P | 128 GB do 1 TB | Do 8 × 7,68 TB | 10 do 40 GbE | 2 × 1200 W, A i B |
Węzły GPU przekazują całe fizyczne karty na PCIe 4.0 x16 bez dzielenia czasu, dlatego liczba zasilania jest taka, jaka jest. Dwie karty w jednej instancji siedzą na tym samym węźle NUMA, ponieważ rozdzielenie ich między socketami kosztowałoby więcej, niż zyskuje druga karta.
Zasilanie i zarządzanie, które nie jest w internecie
Po dwa z wszystkiego, co można podwoić, i sieć zarządzania, która nigdy nie miała trasy do świata zewnętrznego.
Zasilanie A i B, osobne ścieżki
Dwa zasilacze na węzeł na niezależnych obwodach, każdy o mocy wystarczającej do obsługi całej maszyny. Utrata zasilania to tylko zdarzenie logowane, i udowadniamy to na każdym węźle podczas burn-in.
Bateria, potem generator
Bateria pokrywa przełączenie; generatory pokrywają resztę. Przełączenie jest testowane zgodnie z harmonogramem w każdym miejscu, a miejsce, które nie przejdzie testu, nie otrzymuje nowych węzłów, dopóki go nie zda.
Bez podawania „Tier”
Klasyfikacje należą do budynków i do operatorów, którzy je zlecili, a nie do najemcy powtarzającego liczbę w materiałach marketingowych. To, co powiemy Ci na temat każdej lokalizacji, to topologia zasilania i wynik ostatniego testu przełączenia.
Out-of-band we własnej sieci VLAN
Interfejsy zarządzające nie mają publicznej trasy i nigdy jej nie miały. Dostęp odbywa się przez uwierzytelniony tunel, jest rejestrowany i dostępny zarówno dla Ciebie, jak i dla nas.
Konsola w cenie, bez dodatkowych opłat
Serial i VNC do Twojej instancji przez ten tunel. Działa nawet wtedy, gdy Twoja konfiguracja sieci nie działa, a to jedyny moment, w którym ktokolwiek tego potrzebuje.
IPMI na serwerach dedykowanych, poświadczenia na okres
Klienci serwerów dedykowanych otrzymują IPMI przez VPN z kontrolą zasilania, kolejnością rozruchu i wirtualnymi nośnikami. Poświadczenia są rotowane na koniec okresu, a firmware kontrolera jest aktualizowane według naszego harmonogramu, a nie Twojego.
Testy wypalające: trzy dni zanim trafi do klienta
Mniej więcej jeden na dziewięć węzłów nie przechodzi czegoś w pierwszym przebiegu. To prawie zawsze pojedynczy moduł DIMM.
- 01
Firmware do znanej wersji bazowej
Firmware systemu, kontrolera, sieci i dysków jest przypinane do wersji, na której działa cała flota, zanim jakikolwiek test może się rozpocząć. Węzeł testowany na niewłaściwym firmware nie przeszedł żadnego przydatnego testu.
- 02
Pamięć, dokładnie
Wiele pełnych przebiegów po wszystkich zajętych modułach, godziny, a nie minuty. Ten etap wyłapuje większość tego, co wyłapują testy wypalające, i to dlatego harmonogram liczony jest w dniach.
- 03
Test termiczny
Wszystkie rdzenie pod pełnym obciążeniem przez sześć godzin przy wlocie powietrza w górnym zakresie temperatur. Obserwujemy spadek stabilnych zegarów turbo, a nie tylko temperaturę, bo węzeł, który dławi termicznie w piątej godzinie, zrobiłby to samo Tobie w trzecim miesiącu.
- 04
Pełna weryfikacja powierzchni nośników
Każdy dysk zapisywany od początku do końca, odczytywany i porównywany. Liczniki SMART na końcu tego etapu stają się bazą, względem której dysk jest oceniany przez resztę życia.
- 05
Pełna szybkość łącza, w obu kierunkach jednocześnie
Każdy port obciążony do pełnej przepustowości w obu kierunkach przez godzinę, z kontrolą liczników po stronie przełącznika pod kątem błędów, których host by nie zauważył.
- 06
Odetnij jedno łącze, potem drugie
Łącze odłączane, przywracane, to samo po drugiej stronie. Każdy węzeł, który choćby mrugnie, nie trafia do serwisu.
- 07
Cichy dzień we flocie
Dwadzieścia cztery godziny w monitorowaniu bez żadnych instancji. Potem zaczyna przyjmować klientów.
Całkowity czas wynosi około 72 godzin. To również powód, dla którego zasoby w nowej lokalizacji pojawiają się partiami: przyjeżdża regał, a trzy dni później cały jest dostępny naraz.
Kiedy dysk zaczyna zawodzić
Dyski zwykle nie umierają nagle. Zwiastują to przez wiele dni w licznikach, których nikt nie czyta, dlatego nasze są odczytywane co pięć minut.
- 01
Progi, nie pochwały
Błędy nośnika, przekwalifikowane sektory, zużycie i wartości odstające opóźnień są próbkowane w sposób ciągły. Dysk, który przekroczy którykolwiek próg, jest oznaczany do wymiany, gdy jeszcze działa bez zarzutu.
- 02
Zapasowy przejmuje rolę jako pierwszy
Gorący zapasowy dysk jest wprowadzany do lustra, zanim oznaczony dysk zostanie usunięty, dzięki czemu para nigdy nie działa jako pojedyncza kopia, podczas gdy ktoś czeka na technika.
- 03
Przebudowa, celowo ograniczona
Lustro 3,84 TB można przebudować w około czterdzieści minut przy pełnej prędkości. Robimy to wolniej, przez około dwie godziny, bo przebudowa przy pełnej prędkości jest nieodróżnialna od incydentu wydajnościowego dla instancji na tym węźle.
- 04
Jesteś informowany, i nic więcej się nie zmienia
Na stronie instancji pojawia się notatka. Bez restartu, bez migracji, bez okna konserwacyjnego i bez biletu, na który musisz odpowiadać.
- 05
Dysk zostaje w kawałkach
Uszkodzone i wycofane dyski są niszczone na miejscu, a nie odsyłane w celu uzyskania kredytu gwarancyjnego. Kredyt jest wart mniej niż pewność.
Mirror to redundancja, nie kopia zapasowa. Chroni przed awarią dysku, ale nie przed błędną migracją ani entuzjastycznym usunięciem. Snapshoty kosztują pięć euro za pięć slotów, a backup poza węzłem dziewięć euro za 500 GB, zapisywany w innej lokalizacji niż instancja.
Pytania o sprzęt
Nie. Węzły Ryzen działają na pamięci DDR5-5600 bez ECC, i wolimy to powiedzieć wprost, niż żebyś dowiedział się później z arkusza danych. Wszystko, gdzie cicha korupcja pamięci jest niedopuszczalna, należy do EPYC.
Tak, i można to sprawdzić. Uruchom ciągły benchmark jednowątkowy o trzeciej w nocy i ponownie w szczycie; liczby nie powinny się różnić. Jeśli się różnią, otwórz ticket, bo coś jest nie tak i chcielibyśmy o tym wiedzieć.
Nie po nazwie, ale możesz poprosić o anty-afinitet: dwie Twoje instancje umieszczone na osobnych węzłach, osobnych przełącznikach i osobnych zasilaczach. To nic nie kosztuje i wymaga jednego ticketa.
Tam, gdzie to możliwe, instancje są migrowane na żywo i widzisz kilkaset milisekund pauzy. W przeciwnym razie dostajesz co najmniej pięć dni powiadomienia, z oknem, które możesz przesunąć raz, jeśli termin Ci nie pasuje.
Nie. Rdzenie, pamięć i NVMe są przydzielane jednorazowo. Jedynym współdzielonym zasobem jest uplink, dlatego wartość fair-use jest publikowana, a nie sugerowana.
Każdy węzeł w produkcji działa na Zen 4 lub Zen 5. Ostatni z poprzedniej generacji opuścił flotę w 2022 roku i od tego czasu nic nie było sprzedawane na starszym krzemie.
Ten sam sprzęt, trzydzieści cztery miasta
Specyfikacja węzła nie zmienia się wraz z flagą na budynku. Wybierz jurysdykcję i opóźnienie, jakie chcesz, a potem wybierz rozmiar.