Instans GPU diluncurkan bulan ini di Frankfurt, Dallas, dan Singapura. Dua konfigurasi untuk memulai: satu RTX 4000 Ada dengan dua puluh gigabyte VRAM, dan satu L40S dengan empat puluh delapan. Keduanya berada di host EPYC 9354P, terhubung melalui PCIe 4.0 dengan enam belas jalur penuh, diteruskan langsung ke satu instans.
Diteruskan langsung berarti kartu terikat ke instans Anda oleh hypervisor saat boot dan tetap di sana sampai Anda membatalkan. Tidak ada penjadwal, tidak ada antrean, tidak ada penyewa lain, tidak ada partisi VRAM yang juga digunakan orang lain.
Keputusan yang sebenarnya kami ambil
Time-slicing kartu antar penyewa adalah cara yang didukung, terdokumentasi dengan baik, dan sepenuhnya sah untuk menjalankan bisnis ini. Kami menghabiskan sekitar tiga minggu untuk menghitung biayanya, karena aritmetikanya menarik: satu kartu empat puluh delapan gigabyte dapat disajikan sebagai empat instans dua belas gigabyte, yang berarti empat sewa dari satu pembelian dan empat pelanggan dari satu anggaran daya.
Lalu kami menjalankan latensi ekor.
Kartu bersama baik-baik saja ketika penyewa lain diam dan tidak menyenangkan begitu mereka tidak diam. Latensi inferensi pada kartu dengan tiga penyewa aktif lainnya kira-kira seperti yang Anda harapkan pada median dan empat hingga sembilan kali lebih buruk pada persentil ke-99, tergantung pada apa yang kebetulan dilakukan orang lain. Pekerjaan pelatihan lebih buruk lagi, karena pekerjaan pelatihan tidak bersifat bursty dan karena itu tidak pernah mendapatkan celah.
Ada juga masalah lisensi. Perangkat lunak virtualisasi yang memungkinkan partisi bersih membawa lisensi tahunan per kartu, dan biaya itu tidak menguap; biaya itu mendarat di faktur siapa pun yang menyewa irisan tersebut. Kami akan membebankan Anda untuk hak berbagi.
Bagaimana host dibangun
| Elemen | Apa itu |
|---|---|
| CPU host | EPYC 9354P, tiga puluh dua inti, ECC DDR5-4800 |
| Koneksi | PCIe 4.0, enam belas jalur, satu grup IOMMU per kartu |
| Penjepitan vCPU | Dijepit ke soket dan node NUMA tempat kartu berada |
| Memori | Dialokasikan dari node NUMA yang sama, tidak pernah disisipkan |
| Kartu per node | Maksimal empat, maksimal dua di sebagian besar situs, dibatasi oleh daya rak |
| Port | 40 Gbit/s, karena model yang tidak muat di VRAM harus datang dari suatu tempat |
Penjepitan NUMA lebih penting daripada yang disarankan lembar spesifikasi. vCPU di soket yang salah memberi makan kartu di seluruh interkoneksi kehilangan throughput nyata pada apa pun yang mengalirkan data, dan ini adalah konfigurasi yang paling umum salah kami lihat di host GPU di tempat lain.
Daya, dan mengapa hanya ada tiga situs
Kartu dengan tiga ratus lima puluh watt mengubah aritmetika rak. Situs yang nyaman menampung dua belas node tujuan umum menampung empat node GPU dan kemudian kehabisan pendinginan. Frankfurt, Dallas, dan Singapura dipilih karena ketiganya memiliki ruang daya dan denah lantai yang dapat menampung kepadatan tanpa kami menegosiasikan ulang apa pun.
Lebih banyak situs menyusul seiring daya memungkinkan, dan kendala yang jujur selalu listrik daripada permintaan. Jika situs tidak dapat menangani daya tarik, kami lebih baik tidak menjual produk daripada menjualnya dengan throttle termal.
Apa yang tidak dapat Anda lakukan
- Tanpa pemasangan kartu antar node. Instans dua kartu ada dan kedua kartu berada di satu node NUMA. Apa pun yang lebih besar adalah percakapan tentang bare metal.
- Tanpa partisi di dalam instans Anda. Anda memiliki seluruh kartu, dan bagaimana Anda membaginya adalah antara Anda dan kerangka kerja Anda.
- Tanpa pertukaran panas. Mengubah GPU berarti build ulang, karena kartu terikat saat boot.
- Tanpa kartu gaming konsumen. Ditanyakan setiap minggu. Mereka kekurangan profil pendinginan untuk rak dan, dalam kebanyakan kasus, lisensi untuk disewakan sama sekali.
Harga, secara gamblang
Kartu berharga sesuai biayanya dan marginnya lebih tipis daripada katalog lainnya. Tidak ada penagihan per jam, karena penagihan per jam pada perangkat keras khusus berarti menahan kartu menganggur dan membebankan semua orang lain untuk hak istimewa itu. Bulanan, dengan [pengembalian dana tujuh hari] standar (/legal/terms), dan pembayaran khusus kripto yang sama seperti yang lain.
Jika beban kerja Anda benar-benar bursty dan per jam, kami adalah pemasok yang salah dan hyperscaler besar adalah yang tepat. Itu akan berlaku selama kami menolak time-slicing, yang tidak terbatas.