Disimpan sejak Oktober 2019

Passthrough, bukan time-slicing

Setiap GPU yang kami jual adalah kartu fisik utuh yang terikat ke satu instance. Time-slicing akan memungkinkan kami menjual setiap kartu empat kali lipat, dan kami menghitungnya dengan benar.

Instans GPU diluncurkan bulan ini di Frankfurt, Dallas, dan Singapura. Dua konfigurasi untuk memulai: satu RTX 4000 Ada dengan dua puluh gigabyte VRAM, dan satu L40S dengan empat puluh delapan. Keduanya berada di host EPYC 9354P, terhubung melalui PCIe 4.0 dengan enam belas jalur penuh, diteruskan langsung ke satu instans.

Diteruskan langsung berarti kartu terikat ke instans Anda oleh hypervisor saat boot dan tetap di sana sampai Anda membatalkan. Tidak ada penjadwal, tidak ada antrean, tidak ada penyewa lain, tidak ada partisi VRAM yang juga digunakan orang lain.

Keputusan yang sebenarnya kami ambil

Time-slicing kartu antar penyewa adalah cara yang didukung, terdokumentasi dengan baik, dan sepenuhnya sah untuk menjalankan bisnis ini. Kami menghabiskan sekitar tiga minggu untuk menghitung biayanya, karena aritmetikanya menarik: satu kartu empat puluh delapan gigabyte dapat disajikan sebagai empat instans dua belas gigabyte, yang berarti empat sewa dari satu pembelian dan empat pelanggan dari satu anggaran daya.

Lalu kami menjalankan latensi ekor.

Kartu bersama baik-baik saja ketika penyewa lain diam dan tidak menyenangkan begitu mereka tidak diam. Latensi inferensi pada kartu dengan tiga penyewa aktif lainnya kira-kira seperti yang Anda harapkan pada median dan empat hingga sembilan kali lebih buruk pada persentil ke-99, tergantung pada apa yang kebetulan dilakukan orang lain. Pekerjaan pelatihan lebih buruk lagi, karena pekerjaan pelatihan tidak bersifat bursty dan karena itu tidak pernah mendapatkan celah.

Ada juga masalah lisensi. Perangkat lunak virtualisasi yang memungkinkan partisi bersih membawa lisensi tahunan per kartu, dan biaya itu tidak menguap; biaya itu mendarat di faktur siapa pun yang menyewa irisan tersebut. Kami akan membebankan Anda untuk hak berbagi.

Bagaimana host dibangun

ElemenApa itu
CPU hostEPYC 9354P, tiga puluh dua inti, ECC DDR5-4800
KoneksiPCIe 4.0, enam belas jalur, satu grup IOMMU per kartu
Penjepitan vCPUDijepit ke soket dan node NUMA tempat kartu berada
MemoriDialokasikan dari node NUMA yang sama, tidak pernah disisipkan
Kartu per nodeMaksimal empat, maksimal dua di sebagian besar situs, dibatasi oleh daya rak
Port40 Gbit/s, karena model yang tidak muat di VRAM harus datang dari suatu tempat

Penjepitan NUMA lebih penting daripada yang disarankan lembar spesifikasi. vCPU di soket yang salah memberi makan kartu di seluruh interkoneksi kehilangan throughput nyata pada apa pun yang mengalirkan data, dan ini adalah konfigurasi yang paling umum salah kami lihat di host GPU di tempat lain.

Daya, dan mengapa hanya ada tiga situs

Kartu dengan tiga ratus lima puluh watt mengubah aritmetika rak. Situs yang nyaman menampung dua belas node tujuan umum menampung empat node GPU dan kemudian kehabisan pendinginan. Frankfurt, Dallas, dan Singapura dipilih karena ketiganya memiliki ruang daya dan denah lantai yang dapat menampung kepadatan tanpa kami menegosiasikan ulang apa pun.

Lebih banyak situs menyusul seiring daya memungkinkan, dan kendala yang jujur selalu listrik daripada permintaan. Jika situs tidak dapat menangani daya tarik, kami lebih baik tidak menjual produk daripada menjualnya dengan throttle termal.

Apa yang tidak dapat Anda lakukan

  • Tanpa pemasangan kartu antar node. Instans dua kartu ada dan kedua kartu berada di satu node NUMA. Apa pun yang lebih besar adalah percakapan tentang bare metal.
  • Tanpa partisi di dalam instans Anda. Anda memiliki seluruh kartu, dan bagaimana Anda membaginya adalah antara Anda dan kerangka kerja Anda.
  • Tanpa pertukaran panas. Mengubah GPU berarti build ulang, karena kartu terikat saat boot.
  • Tanpa kartu gaming konsumen. Ditanyakan setiap minggu. Mereka kekurangan profil pendinginan untuk rak dan, dalam kebanyakan kasus, lisensi untuk disewakan sama sekali.

Harga, secara gamblang

Kartu berharga sesuai biayanya dan marginnya lebih tipis daripada katalog lainnya. Tidak ada penagihan per jam, karena penagihan per jam pada perangkat keras khusus berarti menahan kartu menganggur dan membebankan semua orang lain untuk hak istimewa itu. Bulanan, dengan [pengembalian dana tujuh hari] standar (/legal/terms), dan pembayaran khusus kripto yang sama seperti yang lain.

Jika beban kerja Anda benar-benar bursty dan per jam, kami adalah pemasok yang salah dan hyperscaler besar adalah yang tepat. Itu akan berlaku selama kami menolak time-slicing, yang tidak terbatas.

Siap saat Anda siap

Pilih kota. Pilih ukuran. Bayar dengan koin.

Tanpa formulir tentang siapa Anda, tanpa menunggu manusia untuk menyetujui, tanpa panggilan telepon untuk memverifikasi apa pun. Invoice dibersihkan dan kredensial masuk ke kotak masuk Anda.