Kartu, bukan potongan satu
GPU bersama adalah pekerjaan orang lain yang selesai sebelum pekerjaan Anda mulai. Setiap kartu di seri ini diteruskan ke satu instance melalui tautan enam belas jalur penuh dan tetap di sana sampai Anda membatalkan, baik idle atau tidak.
A shared GPU is someone else’s job finishing before yours starts. Every card in this line is passed straight through to a single instance and stays there until you cancel.
| Paket | Inti khusus | Memori | Penyimpanan NVMe | Grafis | Kecepatan port | Harga | |
|---|---|---|---|---|---|---|---|
| G-ADA Inference and light training | 8 | 64 GB | 1 TB | 1 × RTX 4000 Ada · 20 GB | 40 Gbit/s | €239.00 /bln | Konfigurasi |
| G-L40SPaling banyak diambil 48 GB of VRAM, undivided | 16 | 128 GB | 2 TB | 1 × L40S · 48 GB | 40 Gbit/s | €749.00 /bln | Konfigurasi |
| G-L40S×2 Two cards, one NUMA node | 32 | 256 GB | 4 TB | 2 × L40S · 96 GB | 40 Gbit/s | €1420.00 /bln | Konfigurasi |
Harga belum termasuk PPN jika berlaku. Traffic: Tanpa batas, penggunaan wajar.
EPYC 9354P host · PCIe 4.0 x16 passthrough · no vGPU time-slicing
Tiga puluh empat kota, dua puluh sembilan negara
Angka latensi adalah median terukur dari probe kami sendiri, bukan brosur vendor. Angka itu bergerak; halaman diperbarui saat terjadi perubahan.
Passthrough, dan mengapa itu penting
Sebagian besar kapasitas GPU murah adalah sebagian kartu yang dibagi dalam antrean. Angka di halaman produk adalah memori kartu, bukan milik Anda, dan throughput yang Anda ukur tergantung siapa lagi yang bangun pagi ini.
Tidak ada vGPU, tanpa time-slicing, tanpa penjadwal antara Anda dan silikon.
Di sini kartu diikat ke instance Anda di tingkat hypervisor melalui tautan PCIe 4.0 enam belas jalur. Seluruh perangkat adalah milik Anda: semua memori, semua unit komputasi, bandwidth mesin salinan penuh. Tidak ada yang dipartisi, tidak ada yang diantrekan, dan tidak ada penyewa lain yang muncul di daftar perangkat Anda.
Konsekuensi praktisnya adalah benchmark Anda malam ini cocok dengan benchmark Anda Selasa lalu. Jalur fine-tuning yang butuh dua hari selesai dalam waktu yang diprediksikan jam pertama Anda. Pekerjaan interaktif tetap interaktif, karena tidak ada pekerjaan batch penyewa lain di depan Anda.
Semua VRAM, setiap saat
Empat puluh delapan gigabyte di L40S, dua puluh di RTX 4000 Ada, dan tidak ada yang dicadangkan untuk partisi hypervisor. Apa yang kartu miliki adalah apa yang proses Anda bisa akses.
Idle tidak membebani ekstra
Kartu milik Anda per bulan, bukan per detik. Biarkan model tetap dimuat selama tiga minggu antara eksperimen dan tidak ada yang mengambilnya saat Anda tidur.
Dua kartu, satu host
Tingkat dual-kartu menempatkan kedua perangkat di domain NUMA yang sama pada host yang sama. Mereka berbicara melalui PCIe daripada tautan kartu-ke-kartu, yang perlu diketahui sebelum Anda merencanakan topologi pelatihan di sekitar mereka.
Stack Anda sendiri
Kami menyerahkan mesin dengan kartu di dalamnya dan tidak ikut campur. Driver, container runtime, versi framework, dan kernel adalah milik Anda. Tidak ada lapisan terkelola yang punya opini tentang Python Anda.
Kartu ini cocok untuk apa
Kedua kartu ini kelas workstation, bukan puncak cluster pelatihan, dan posisi jujur mengikuti dari itu.
Inferensi, fine-tuning, rendering, dan pekerjaan numerik batch. Dalam urutan itu.
Jika model Anda muat dalam empat puluh delapan gigabyte, L40S akan melayaninya dengan kompeten selama Anda terus membayarnya. Jika tidak muat, tidak ada antusiasme yang membuatnya muat, dan langkah jujur berikutnya adalah kuantisasi, sharding di seluruh tier dual-card, atau kelas mesin yang berbeda sama sekali.
| Beban kerja | Kartu mana | Batasan sesungguhnya |
|---|---|---|
| Melayani model terkuantisasi ke pengguna nyata | RTX 4000 Ada | Memori, lalu konkurensi permintaan |
| Melayani model ukuran menengah pada presisi penuh | L40S | Empat puluh delapan gigabyte adalah batas yang menentukan |
| Fine-tuning dengan adapter | L40S | VRAM selama backward pass, bukan throughput mentah |
| Fine-tune penuh model besar | Dua L40S, atau tempat lain | Bandwidth antar-kartu melalui PCIe menjadi batas |
| Rendering batch dan encode video | Keduanya | Disk dan jaringan lebih sering daripada kartu |
| Simulasi numerik presisi ganda | Biasanya bukan | Ini bukan komponen presisi ganda. Ambil core EPYC |
Siapa yang sebaiknya tidak membeli ini
Kapasitas GPU menarik perencanaan optimis lebih dari produk lain yang kami jual. Tiga kelompok orang sebaiknya melewati lini ini.
Hal paling berguna yang bisa kami katakan kepada sebagian pelanggan adalah bahwa kami toko yang salah.
Anda melatih sesuatu yang sangat besar dari nol
Pelatihan multi-node dengan interkoneksi bandwidth tinggi antar-host bukan ini. Dua kartu melalui PCIe di satu host adalah batas kami, dan berpura-pura sebaliknya akan membuang berminggu-minggu waktu Anda.
Anda menginginkan penagihan per detik
Kartu disewa per bulan. Jika penggunaan Anda benar-benar dua puluh menit seminggu, platform terukur akan membebani Anda lebih sedikit daripada kami, dan kami lebih suka mengatakannya sekarang.
Model Anda tidak muat
Sembilan puluh enam gigabyte dengan dua kartu adalah maksimum yang dapat dialamatkan di sini. Hitung aritmetika memori untuk bobot, aktivasi, dan status pengoptimal sebelum memesan, bukan setelahnya.
Anda membutuhkan presisi ganda
Ini komponen presisi tunggal dan presisi campuran. Kode ilmiah yang bersikeras pada throughput FP64 akan berjalan lebih cepat di empat puluh delapan core EPYC daripada di salah satu kartu.
Anda ingin kami mengelola tumpukan
Kami tidak memelihara driver Anda, versi CUDA Anda, atau matriks framework Anda. Add-on penguatan mencakup baseline sistem operasi dan berhenti di situ.
Host di sekitar kartu
GPU yang kelaparan adalah pemanas ruangan yang mahal. Host sama pentingnya dengan kartu, dan di sanalah sebagian besar penawaran GPU murah diam-diam memotong biaya.
EPYC 9354P, memori ECC, NVMe lokal untuk mesin, port empat puluh gigabit.
Core yang bisa memberinya makan
Delapan hingga tiga puluh dua core EPYC khusus tergantung tier, ditempelkan di domain NUMA yang sama dengan kartu. Pemuatan data dan preprocessing adalah alasan paling umum pelatihan berhenti, dan itu kerja CPU.
Memori ECC di host
DDR5-4800 terdaftar, enam puluh empat hingga dua ratus lima puluh enam gigabyte. Pekerjaan empat puluh delapan jam adalah hal yang tidak boleh dibatalkan oleh satu bit terbalik di buffer dataloader.
NVMe yang bisa mengimbangi
Satu hingga empat terabyte NVMe Gen4 lokal, dicerminkan. Dataset dialirkan dari mesin itu sendiri dan bukan melalui volume jaringan yang dibaca orang lain.
Port 40 gigabit
Menarik dataset multi-terabyte seharusnya memakan waktu satu malam. Penggunaan wajar pada port 40 gigabit adalah 250 terabyte per bulan, dipublikasikan di halaman harga.
Konsol out-of-band
Serial dan VNC melalui tunnel terautentikasi, sudah termasuk. Ketika instalasi driver salah pada tengah malam, Anda masih dapat menjangkau mesin, yang merupakan alasan utama keberadaannya.
Kartu di-pass-through, jadi driver diinstal di dalam instance Anda seperti mesin lain. Tidak ada apa pun di host yang menyentuh framework Anda, dan reboot tidak menegosiasikan ulang apa pun.
Di mana kartu-kartu berada
Amsterdam, Frankfurt, London, New York, Dallas, Los Angeles, Singapura, dan Tokyo. Itulah lantai dengan kepadatan daya dan pendinginan yang mampu menjalankan kartu pada beban penuh secara terus-menerus, bukan dalam ledakan yang sopan.
Delapan situs di enam negara. GPU membutuhkan daya dan pendinginan, bukan kode pos.
Frankfurt adalah lantai GPU tersibuk yang kami operasikan dan menerima kartu baru lebih dulu. Dallas adalah tempat termudah untuk mendapatkan kapasitas dalam waktu singkat, karena daya di sana murah dan lantainya besar. Los Angeles membawa kartu tetapi sering kosong, jadi pesan lebih awal jika rute ke arah barat ke Asia yang Anda beli.
Stok benar-benar bergerak pada lini ini. Kartu yang tampak tersedia pada siang hari mungkin tidak ada di malam hari, dan kami lebih suka menampilkan label kehabisan stok yang akurat daripada menerima pesanan yang tidak dapat kami penuhi minggu ini.
| Situs | Catatan | Penggunaan umum |
|---|---|---|
| Amsterdam | Situs terpadat di armada, semuanya dikirim ke sini terlebih dahulu | Inferensi Eropa dengan latensi rendah ke sebagian besar benua |
| Frankfurt | Lantai GPU tersibuk, pertama menerima kartu baru | Pelatihan dan penyesuaian halus di mana kapasitas lebih penting daripada milidetik terakhir |
| London | Latensi transatlantik terendah di Eropa | Melayani pengguna di kedua sisi Atlantik dari satu tempat |
| New York | Jangkar pantai timur, rangkaian produk lengkap | Inferensi Amerika Utara |
| Dallas | Daya murah, lantai luas, kapasitas termudah | Pekerjaan batch panjang dan apa pun yang sensitif terhadap harga |
| Los Angeles | Rute arah barat terbaik yang kami miliki di luar Asia | Melayani lingkar Pasifik dari Amerika Utara |
| Singapura | Pilihan standar untuk Asia Tenggara | Inferensi regional |
| Tokyo | Waktu perjalanan pulang-pergi paling stabil di kawasan | Lalu lintas Jepang dan Korea yang sensitif terhadap latensi |
Pekerjaan panjang, dan cara untuk tidak kehilangannya
Penyesuaian halus selama 48 jam adalah taruhan bahwa tidak ada yang salah selama dua hari. Strukturkan pekerjaan sehingga kehilangan taruhan menghabiskan satu jam, bukan akhir pekan.
Checkpoint. Kami akan tetap mengatakannya setelah Anda mendengarnya seratus kali.
- 01
Checkpoint ke NVMe lokal, sering
Setiap beberapa ratus langkah, ke disk lokal, karena cukup cepat sehingga biayanya dapat diabaikan. Pekerjaan yang tidak dapat dilanjutkan adalah pekerjaan yang pada akhirnya akan Anda jalankan dua kali.
- 02
Salin checkpoint dari mesin
NVMe lokal dicerminkan, tidak abadi. Cadangan off-node menulis ke kota yang berbeda setiap malam, dan itu adalah asuransi termurah di halaman ini.
- 03
Snapshot sebelum menyentuh driver
Peningkatan driver dan framework adalah penyebab utama lingkungan yang berfungsi menjadi tidak berfungsi. Snapshot membutuhkan detik untuk dibuat dan detik untuk dipulihkan.
- 04
Pantau suhu dan clock, bukan hanya loss
Kartu akan melakukan throttle saat ruangan sedang tidak bersahabat. Jika throughput turun tanpa perubahan pada kode Anda, lihat angka clock sebelum menulis ulang dataloader.
- 05
Tanyakan sebelum menambah skala secara horizontal
Jika langkah selanjutnya adalah empat atau delapan kartu, beri tahu support apa yang ingin Anda capai. Terkadang jawabannya adalah mesin bare-metal, dan kadang-kadang jawabannya adalah kami bukan pemasok yang tepat.
Saat perangkat keras mengalami kegagalan
GPU biasanya menurun secara bertahap daripada langsung mati: clock yang turun, error memori yang terkoreksi pada kartu, atau pekerjaan yang tiba-tiba berjalan sepertiga lebih lambat tanpa alasan yang dapat Anda temukan dalam kode.
Kartu gagal dengan cara yang berbeda dari disk. Lebih lambat, dan dengan lebih banyak peringatan.
Monitoring kami memantau suhu kartu, perilaku clock, dan penghitung error di setiap host. Saat kartu mulai berperilaku tidak normal, kami menghubungi Anda sebelum kartu berhenti bekerja, dan kami menjadwalkan penggantian di sekitar pekerjaan Anda, bukan di tengah-tengahnya. Jika kartu gagal total, instance Anda dibangun ulang di host lain di situs yang sama dengan volume dan alamat yang tetap utuh.
Pemulihan di lini ini lebih lambat daripada di tempat lain dalam armada, dan perlu kami jelaskan secara terus terang alasannya: satu terabyte dataset dan model yang menetap membutuhkan waktu beberapa menit untuk dipindahkan dan dimuat ulang. Rencanakan satu jam daripada lima belas menit, dan simpan checkpoint di tempat selain mesin yang sedang bermasalah.
Peringatan sebelum kegagalan, jika memungkinkan
Penghitung error dan telemetri clock dibaca secara berkelanjutan. Sebagian besar penggantian kartu terjadi dalam jendela yang kami sepakati dengan pelanggan sebelumnya.
Volume dan alamat tetap utuh
Proses rebuild membawa isi NVMe dan alamat IP Anda. Tidak ada yang perlu diubah dalam DNS atau sertifikat Anda.
Kredit otomatis
Uptime kontraktual 99.99% yang sama berlaku di sini seperti di tempat lain, dan kredit diberikan tanpa formulir klaim.
Pertanyaan tentang lini ini
Perangkat fisik terikat ke instance Anda melalui tautan enam belas jalur penuh. Tidak ada partisi vGPU, tidak ada time-slicing, dan tidak ada penyewa lain di atasnya. Daftar perangkat Anda menampilkan satu kartu karena memang ada satu kartu.
Tidak. Kartu bersifat bulanan, dan komitmen terpendek adalah satu bulan. Jika beban kerja Anda benar-benar bersifat bursty, penyedia dengan sistem metered akan lebih murah, dan tidak ada versi percakapan ini di mana kami berpura-pura sebaliknya.
Tidak ada, kecuali Anda memintanya. Image dikirim bersih dan driver dipasang di dalam instance Anda, karena separuh pelanggan GPU kami memiliki pandangan kuat tentang versi, dan separuh lainnya memiliki container yang membawa driver sendiri.
Tidak. Keduanya berada di host yang sama dan domain NUMA yang sama, dan berkomunikasi melalui PCIe. Untuk pekerjaan data-paralel dengan pertukaran gradien yang sederhana, ini cukup. Untuk apa pun yang mengasumsikan fabric kartu-ke-kartu dengan bandwidth tinggi, ini tidak cukup, dan Anda harus menyesuaikan ekspektasi Anda.
Tidak. Passthrough memerlukan host yang dibangun khusus untuk itu, dengan topologi PCIe dan alokasi daya yang memadai. Pindah ke lini ini berarti instance baru dan penyalinan data.
Volume akan dihapus dan kartu kembali ke pool. Bawa checkpoint Anda sebelum masa berakhir, karena instance yang dibatalkan benar-benar hilang, bukan disimpan di suatu tempat menunggu Anda berubah pikiran.
Ambil seluruh kartu
Periksa dulu aritmatika memori, pilih situs dengan kapasitas yang tersedia, dan bayar dengan koin. Akses root tiba dalam waktu kurang dari satu menit, keputusan driver tetap ada di tangan Anda, dan tujuh hari pertama dapat dikembalikan tanpa alasan.