Apa yang sebenarnya ada di rak
Dua generasi CPU, tidak ada yang ketiga. Memori yang mengoreksi kesalahannya sendiri di lini yang membutuhkannya, NVMe tingkat perusahaan dalam pasangan tercermin dengan cadangan yang menganggur di sebelahnya, dan tiga hari burn-in sebelum sebuah node diizinkan bertemu pelanggan.
Dua generasi, dan tidak ada yang lebih lama
Kebanyakan penyedia menjalankan tiga atau empat generasi sekaligus dan menjualnya dengan harga yang sama, yang menjadi alasan mengapa dua server dengan spesifikasi identik bisa berbeda empat puluh persen pada beban kerja yang sama. Sebagai gantinya kami menjaga armada tetap sempit.
Tak ada yang lebih dari satu generasi tertinggal dalam produksi. Aturan ini berlaku sejak 2022.
Ryzen 9 9950X, Zen 5
16 inti, 32 utas, turbo hingga 5,7 GHz. Ini adalah utas tunggal tercepat yang bisa kami beli, dan kecepatan utas tunggal masih menentukan seberapa cepat sebuah permintaan selesai pada kebanyakan aplikasi nyata.
EPYC 9354P, Zen 4
32 inti dan 64 utas pada satu soket, dua belas kanal memori, ECC terdaftar. Jika jumlah inti, kapasitas memori, dan perilaku NUMA yang dapat diprediksi lebih penting daripada jam puncak, bagian inilah yang menang.
Satu soket jika memungkinkan
Akses memori lintas-soket adalah jurang latensi yang tak bisa Anda atasi. Hanya konfigurasi bare-metal terbesar yang dual-soket, dan dual-soket karena pelanggan secara eksplisit meminta 64 inti.
Inti dialokasikan sekali
Inti yang dijual kepada Anda dijadwalkan untuk Anda. Tak ada kredit burst, tak ada rasio oversubscription, tak ada waktu curian yang muncul saat beban maupun menghilang sebelum Anda bisa menangkap layarnya.
Mengapa bukan silikon server terbaru
Bagian server Zen 5 ada di lab, bukan di armada. Saat menggantikan 9354P, ini akan muncul di changelog dengan tanggal migrasi, bukan sebagai frasa di halaman depan enam bulan sebelum ada yang bisa membelinya.
Memori, dan di mana ECC sebenarnya berada
Kesalahan memori tidak jarang; mereka hanya tak terlihat sampai sesuatu yang penting menjadi salah secara halus. Di lini server, setiap kesalahan dikoreksi dan dicatat.
Node EPYC membawa dua belas modul DDR5-4800 ECC terdaftar, satu per kanal, semuanya terisi. Mengisi semua kanal bukan soal kapasitas, melainkan bandwidth: bus memori setengah terisi pada bagian 32-inti adalah hambatan yang akan Anda rasakan pada apa pun yang menyentuh RAM dengan cepat.
Node Ryzen menjalankan DDR5-5600 tanpa ECC, karena platform konsumen tidak menawarkannya dalam bentuk yang bisa kami andalkan. Ini dinyatakan jelas di sini, bukan disembunyikan: jika beban kerja Anda memerlukan koreksi kesalahan, lini EPYC mulai dari delapan puluh sembilan euro dan ada untuk alasan itu.
Kesalahan yang dapat dikoreksi dihitung
Peringkat yang menghasilkan lebih dari beberapa koreksi sehari ditandai, dan modul diganti pada jendela pemeliharaan berikutnya, apakah ada yang salah perilaku atau tidak.
Kesalahan yang tidak dapat dikoreksi menguras node
Instans bermigrasi keluar, node meninggalkan kumpulan, dan DIMM diganti sebelum kembali. Anda mungkin melihat migrasi langsung; Anda seharusnya tidak melihat crash.
Tanpa peniupan, tanpa penggabungan halaman
Memori dialokasikan sekali dan tidak dihitung dua kali. Penggabungan halaman yang sama dimatikan di seluruh armada, karena itu adalah kanal sampingan antarpenyewa dan klaim kinerja yang menguap di bawah beban nyata.
Kapasitas per node sengaja besar
Node EPYC hadir dengan memori yang cukup sehingga paket terbesar yang di-host masih menyisakan ruang. Node yang penuh hingga gigabyte terakhir tak punya tempat untuk migrasi ketika tetangga harus pindah.
NVMe, ketahanan, dan cadangan yang tak melakukan apa pun
Setiap drive adalah bagian perusahaan Gen4 dengan perlindungan kehilangan daya, yaitu bank kapasitor yang menyelesaikan penulisan yang telah diakui ketika daya hilang di tengah flush.
Cadangan panas per node, menganggur, menunggu. Itu asuransi termurah di gedung.
Pasangan yang direfleksikan, selalu
Pembacaan tersebar di kedua bagian; penulisan diakui dari cache terlindungi dan mendarat di keduanya. Kegagalan satu drive sedikit mengubah profil kinerja dan sama sekali tidak mengubah ketersediaan Anda.
Cadangan panas per node
Satu drive per node menganggur dan kosong. Ketika mirror kehilangan separuh, spare mengambil alih secara otomatis dan rebuild dimulai sebelum siapa pun membaca alert.
Headroom ketahanan, bukan batas ketahanan
Node umum menggunakan drive kelas 1 DWPD; node penyimpanan menggunakan 3 DWPD untuk tingkatan tulis. Drive diganti pada delapan puluh persen dari ketahanan terukur, bukan dijalankan sampai angka pada lembar data.
Tidak ada drive konsumen di mana pun
Tidak di tier cache, tidak di tier bulk, tidak di node yang dibuat seseorang dengan cepat pada tahun 2021 dan dilupakan. NVMe konsumen cepat selama sebelas detik dan kemudian tidak, yang merupakan trade-off yang baik di laptop.
Kapasitas dialokasikan, bukan dijanjikan
Penyimpanan tidak di-thin-provisioned antar-tenant. Jika paket mengatakan 800 GB, 800 GB ada di node itu dengan nama Anda, dan tidak ada orang lain yang bisa tumbuh ke dalamnya.
Apa yang ada di setiap kelas node
Lima kelas node membawa lima lini produk. Penyimpanan massal di kelas S adalah SATA enterprise di belakang tier tulis NVMe, yang merupakan satu-satunya media berputar di seluruh armada.
| Kelas | CPU | Memori | NVMe | Jaringan | Daya |
|---|---|---|---|---|---|
| R — Ryzen NVMe | Ryzen 9 9950X, 16C/32T | 128 GB DDR5-5600 | 2 × 3.84 TB mirror, 1 spare | 2 × 10 GbE, LACP | 2 × 800 W, A dan B |
| E — EPYC High-Memory | EPYC 9354P, 32C/64T | 12 × DDR5-4800 ECC RDIMM | 4 × 3.84 TB mirror, 1 spare | 2 × 25 GbE, LACP | 2 × 1200 W, A dan B |
| G — GPU | EPYC 9354P, 32C/64T | 256 GB ECC DDR5-4800 | 4 × 3.84 TB mirror, 1 spare | 2 × 40 GbE, LACP | 2 × 2000 W, A dan B |
| S — Storage | EPYC 9354P, 32C/64T | 128 GB ECC DDR5-4800 | 2 × 3.84 TB tier tulis, SATA bulk di belakangnya | 2 × 25 GbE, LACP | 2 × 1200 W, A dan B |
| BM — Bare Metal | Ryzen 9950X, atau satu atau dua EPYC 9354P | 128 GB hingga 1 TB | Hingga 8 × 7.68 TB | 10 hingga 40 GbE | 2 × 1200 W, A dan B |
Node GPU melewatkan seluruh kartu fisik pada PCIe 4.0 x16 tanpa time-slicing, itulah sebabnya angka daya seperti itu. Dua kartu dalam satu instance berada di node NUMA yang sama, karena memisahkannya di seluruh socket akan memakan biaya lebih dari yang diperoleh dari kartu kedua.
Catu daya, dan manajemen yang tidak terhubung ke internet
Dua dari semua yang bisa digandakan, dan jaringan manajemen yang tidak pernah memiliki rute ke dunia luar.
Feed A dan B, jalur terpisah
Dua supply per node pada distribusi independen, masing-masing berukuran untuk membawa seluruh mesin sendirian. Kehilangan satu feed adalah peristiwa yang dicatat dan tidak lebih dari itu, dan kami membuktikannya di setiap node selama burn-in.
Baterai, lalu generator
Baterai menutupi transfer; generator menutupi sisanya. Transfer diuji sesuai jadwal di setiap lokasi, dan lokasi yang gagal uji tidak menerima node baru sampai lulus.
Tidak ada nomor tier yang disebutkan
Peringkat adalah milik gedung dan operator yang memesannya, bukan milik penyewa yang mengulangi angka dalam materi pemasaran. Apa yang akan kami sampaikan kepada Anda, per situs, adalah topologi feed dan hasil uji transfer terakhir.
Out-of-band di VLAN sendiri
Antarmuka manajemen tidak memiliki rute publik dan tidak pernah memilikinya. Akses melalui tunnel yang terautentikasi, dicatat, dan tersedia untuk Anda juga untuk kami.
Konsol disertakan, tanpa biaya
Serial dan VNC ke instance Anda melalui tunnel itu. Berfungsi saat konfigurasi jaringan Anda tidak berfungsi, yang merupakan satu-satunya saat siapa pun menginginkannya.
IPMI pada metal, kredensial per periode
Pelanggan bare-metal mendapatkan IPMI melalui VPN dengan kontrol daya, urutan boot, dan media virtual. Kredensial diputar saat periode berakhir, dan firmware pengontrol ditambal sesuai jadwal kami, bukan jadwal Anda.
Burn-in: tiga hari sebelum bertemu pelanggan
Sekitar satu dari sembilan node gagal dalam sesuatu pada percobaan pertama. Hampir selalu satu DIMM.
- 01
Firmware ke baseline yang diketahui
Firmware sistem, kontroller, jaringan, dan drive dipatok ke versi yang digunakan armada sebelum pengujian apa pun diizinkan dimulai. Node yang diuji pada firmware yang salah tidak menguji apa pun yang berguna.
- 02
Memori, dalam waktu yang lama
Beberapa loop penuh pada setiap modul yang terisi, berjam-jam bukan berhari-hari. Tahap ini menangkap sebagian besar yang ditangkap oleh burn-in, dan itulah alasan jadwal diukur dalam hari.
- 03
Thermal soak
Setiap inti pada beban penuh selama enam jam dengan inlet di ujung hangat rentangnya. Kami mengamati penurunan clock boost yang berkelanjutan, bukan hanya suhu, karena node yang mengalami thermal throttle pada jam kelima akan melakukannya pada Anda di bulan ketiga.
- 04
Verifikasi penyimpanan seluruh permukaan
Setiap drive ditulis dari awal hingga akhir, dibaca kembali, dan dibandingkan. Penghitung SMART pada akhir tahap ini menjadi baseline yang digunakan untuk menilai drive selama sisa hidupnya.
- 05
Kecepatan line rate, dua arah sekaligus
Setiap port didorong hingga kapasitas di kedua arah selama satu jam, dengan penghitung sisi switch diperiksa untuk kesalahan yang tidak akan diperhatikan host.
- 06
Cabut satu feed, lalu yang lain
Sebuah feed dilepas, dipulihkan, lalu hal yang sama di sisi lain. Node yang sedikit saja berkedip tidak akan masuk layanan.
- 07
Sehari yang tenang di armada
Dua puluh empat jam dalam pemantauan tanpa membawa instance sama sekali. Kemudian mulai menerima pelanggan.
Total waktu yang berlalu sekitar 72 jam. Ini juga mengapa stok di situs baru muncul dalam batch, bukan menetes: sebuah rak tiba, dan tiga hari kemudian semuanya tersedia sekaligus.
Saat drive mulai gagal
Drive biasanya tidak mati mendadak. Mereka mengumumkannya berhari-hari dalam penghitung yang tidak dibaca siapa pun, itulah sebabnya penghitung kami dibaca setiap lima menit.
- 01
Ambang batas, bukan pidato
Kesalahan media, sektor realokasi, tingkat keausan, dan pencilan latensi diambil sampelnya secara terus menerus. Drive yang melewati ambang batas mana pun ditandai untuk penggantian saat masih berfungsi dengan sempurna.
- 02
Cadangan aktif mengambil alih lebih dulu
Cadangan panas dimasukkan ke dalam mirror sebelum drive yang ditandai dilepas, sehingga pasangan tidak pernah berjalan sebagai salinan tunggal saat menunggu teknisi.
- 03
Rebuild, diperlambat dengan sengaja
Mirror 3,84 TB dapat dibangun ulang dalam sekitar empat puluh menit pada kecepatan penuh. Kami menjalankannya lebih lambat, sekitar dua jam, karena membangun ulang pada kecepatan penuh tidak dapat dibedakan dari insiden kinerja bagi instance di node tersebut.
- 04
Anda diberi tahu, dan tidak ada hal lain yang berubah
Catatan muncul di halaman instance. Tidak ada reboot, tidak ada migrasi, tidak ada window pemeliharaan, dan tidak ada tiket yang harus Anda jawab.
- 05
Disk dalam keadaan hancur
Disk yang gagal dan pensiun dihancurkan di lokasi, bukan dikembalikan untuk kredit garansi. Kredit tersebut nilainya lebih kecil daripada kepastian.
Mirror adalah redundansi, bukan cadangan. Ia melindungi Anda dari kegagalan disk, bukan dari migrasi yang buruk atau penghapusan yang ceroboh. Snapshot berbiaya lima euro untuk lima slot dan cadangan off-node sembilan euro per 500 GB, ditulis ke lokasi yang berbeda dari instance.
Pertanyaan tentang perangkat keras
Tidak. Node Ryzen menggunakan DDR5-5600 non-ECC, dan kami lebih suka mengatakannya di sini daripada membiarkan Anda mengetahuinya dari lembar data nanti. Apa pun yang tidak dapat menerima korupsi memori diam-diam termasuk dalam kategori EPYC.
Ya, dan itu bisa diperiksa. Jalankan benchmark inti tunggal yang berkelanjutan pada pukul tiga pagi dan lagi pada waktu puncak; angkanya seharusnya tidak berubah. Jika berubah, buka tiket, karena ada yang salah dan kami ingin mengetahuinya.
Tidak berdasarkan nama, tetapi Anda dapat meminta anti-afinitas: dua instance Anda ditempatkan di node terpisah, switch terpisah, dan aliran listrik terpisah. Tidak dipungut biaya dan hanya butuh satu tiket.
Jika pekerjaan memungkinkan, instance dimigrasikan secara langsung dan Anda akan melihat jeda beberapa ratus milidetik. Jika tidak, Anda akan mendapat pemberitahuan setidaknya lima hari sebelumnya, dengan jendela yang dapat Anda pindahkan satu kali jika waktunya tidak tepat untuk Anda.
Tidak. Inti, memori, dan NVMe dialokasikan masing-masing sekali. Satu-satunya sumber daya bersama adalah uplink, itulah mengapa angka penggunaan wajar dipublikasikan daripada diimplikasikan.
Setiap node yang berproduksi menggunakan Zen 4 atau Zen 5. Generasi sebelumnya yang terakhir meninggalkan armada pada tahun 2022, dan tidak ada yang dijual dengan silikon yang lebih lama sejak itu.
Perangkat keras yang sama, tiga puluh empat kota
Spesifikasi node tidak berubah dengan bendera di gedung. Pilih yurisdiksi dan latensi yang Anda inginkan, lalu pilih ukurannya.