Baris tiga dari lima

Kartu, bukan potongan satu

GPU bersama adalah pekerjaan orang lain yang selesai sebelum pekerjaan Anda mulai. Setiap kartu di seri ini diteruskan ke satu instance melalui tautan enam belas jalur penuh dan tetap di sana sampai Anda membatalkan, baik idle atau tidak.

Armada
mulai€239
DeploymentKurang dari satu menit
Tersedia di8
TrafficTanpa batas, penggunaan wajar

A shared GPU is someone else’s job finishing before yours starts. Every card in this line is passed straight through to a single instance and stays there until you cancel.

Harga
PaketInti khususMemoriPenyimpanan NVMeGrafisKecepatan portHarga
G-ADA
Inference and light training
864 GB1 TB1 × RTX 4000 Ada · 20 GB40 Gbit/s€239.00
/bln
Konfigurasi
G-L40SPaling banyak diambil
48 GB of VRAM, undivided
16128 GB2 TB1 × L40S · 48 GB40 Gbit/s€749.00
/bln
Konfigurasi
G-L40S×2
Two cards, one NUMA node
32256 GB4 TB2 × L40S · 96 GB40 Gbit/s€1420.00
/bln
Konfigurasi

Harga belum termasuk PPN jika berlaku. Traffic: Tanpa batas, penggunaan wajar.

EPYC 9354P host · PCIe 4.0 x16 passthrough · no vGPU time-slicing

00

Tiga puluh empat kota, dua puluh sembilan negara

Angka latensi adalah median terukur dari probe kami sendiri, bukan brosur vendor. Angka itu bergerak; halaman diperbarui saat terjadi perubahan.

01

Passthrough, dan mengapa itu penting

Sebagian besar kapasitas GPU murah adalah sebagian kartu yang dibagi dalam antrean. Angka di halaman produk adalah memori kartu, bukan milik Anda, dan throughput yang Anda ukur tergantung siapa lagi yang bangun pagi ini.

Tidak ada vGPU, tanpa time-slicing, tanpa penjadwal antara Anda dan silikon.

Di sini kartu diikat ke instance Anda di tingkat hypervisor melalui tautan PCIe 4.0 enam belas jalur. Seluruh perangkat adalah milik Anda: semua memori, semua unit komputasi, bandwidth mesin salinan penuh. Tidak ada yang dipartisi, tidak ada yang diantrekan, dan tidak ada penyewa lain yang muncul di daftar perangkat Anda.

Konsekuensi praktisnya adalah benchmark Anda malam ini cocok dengan benchmark Anda Selasa lalu. Jalur fine-tuning yang butuh dua hari selesai dalam waktu yang diprediksikan jam pertama Anda. Pekerjaan interaktif tetap interaktif, karena tidak ada pekerjaan batch penyewa lain di depan Anda.

01

Semua VRAM, setiap saat

Empat puluh delapan gigabyte di L40S, dua puluh di RTX 4000 Ada, dan tidak ada yang dicadangkan untuk partisi hypervisor. Apa yang kartu miliki adalah apa yang proses Anda bisa akses.

02

Idle tidak membebani ekstra

Kartu milik Anda per bulan, bukan per detik. Biarkan model tetap dimuat selama tiga minggu antara eksperimen dan tidak ada yang mengambilnya saat Anda tidur.

03

Dua kartu, satu host

Tingkat dual-kartu menempatkan kedua perangkat di domain NUMA yang sama pada host yang sama. Mereka berbicara melalui PCIe daripada tautan kartu-ke-kartu, yang perlu diketahui sebelum Anda merencanakan topologi pelatihan di sekitar mereka.

04

Stack Anda sendiri

Kami menyerahkan mesin dengan kartu di dalamnya dan tidak ikut campur. Driver, container runtime, versi framework, dan kernel adalah milik Anda. Tidak ada lapisan terkelola yang punya opini tentang Python Anda.

02

Kartu ini cocok untuk apa

Kedua kartu ini kelas workstation, bukan puncak cluster pelatihan, dan posisi jujur mengikuti dari itu.

Inferensi, fine-tuning, rendering, dan pekerjaan numerik batch. Dalam urutan itu.

Jika model Anda muat dalam empat puluh delapan gigabyte, L40S akan melayaninya dengan kompeten selama Anda terus membayarnya. Jika tidak muat, tidak ada antusiasme yang membuatnya muat, dan langkah jujur berikutnya adalah kuantisasi, sharding di seluruh tier dual-card, atau kelas mesin yang berbeda sama sekali.

Beban kerjaKartu manaBatasan sesungguhnya
Melayani model terkuantisasi ke pengguna nyataRTX 4000 AdaMemori, lalu konkurensi permintaan
Melayani model ukuran menengah pada presisi penuhL40SEmpat puluh delapan gigabyte adalah batas yang menentukan
Fine-tuning dengan adapterL40SVRAM selama backward pass, bukan throughput mentah
Fine-tune penuh model besarDua L40S, atau tempat lainBandwidth antar-kartu melalui PCIe menjadi batas
Rendering batch dan encode videoKeduanyaDisk dan jaringan lebih sering daripada kartu
Simulasi numerik presisi gandaBiasanya bukanIni bukan komponen presisi ganda. Ambil core EPYC
03

Siapa yang sebaiknya tidak membeli ini

Kapasitas GPU menarik perencanaan optimis lebih dari produk lain yang kami jual. Tiga kelompok orang sebaiknya melewati lini ini.

Hal paling berguna yang bisa kami katakan kepada sebagian pelanggan adalah bahwa kami toko yang salah.

01

Anda melatih sesuatu yang sangat besar dari nol

Pelatihan multi-node dengan interkoneksi bandwidth tinggi antar-host bukan ini. Dua kartu melalui PCIe di satu host adalah batas kami, dan berpura-pura sebaliknya akan membuang berminggu-minggu waktu Anda.

02

Anda menginginkan penagihan per detik

Kartu disewa per bulan. Jika penggunaan Anda benar-benar dua puluh menit seminggu, platform terukur akan membebani Anda lebih sedikit daripada kami, dan kami lebih suka mengatakannya sekarang.

03

Model Anda tidak muat

Sembilan puluh enam gigabyte dengan dua kartu adalah maksimum yang dapat dialamatkan di sini. Hitung aritmetika memori untuk bobot, aktivasi, dan status pengoptimal sebelum memesan, bukan setelahnya.

04

Anda membutuhkan presisi ganda

Ini komponen presisi tunggal dan presisi campuran. Kode ilmiah yang bersikeras pada throughput FP64 akan berjalan lebih cepat di empat puluh delapan core EPYC daripada di salah satu kartu.

05

Anda ingin kami mengelola tumpukan

Kami tidak memelihara driver Anda, versi CUDA Anda, atau matriks framework Anda. Add-on penguatan mencakup baseline sistem operasi dan berhenti di situ.

04

Host di sekitar kartu

GPU yang kelaparan adalah pemanas ruangan yang mahal. Host sama pentingnya dengan kartu, dan di sanalah sebagian besar penawaran GPU murah diam-diam memotong biaya.

EPYC 9354P, memori ECC, NVMe lokal untuk mesin, port empat puluh gigabit.

01

Core yang bisa memberinya makan

Delapan hingga tiga puluh dua core EPYC khusus tergantung tier, ditempelkan di domain NUMA yang sama dengan kartu. Pemuatan data dan preprocessing adalah alasan paling umum pelatihan berhenti, dan itu kerja CPU.

02

Memori ECC di host

DDR5-4800 terdaftar, enam puluh empat hingga dua ratus lima puluh enam gigabyte. Pekerjaan empat puluh delapan jam adalah hal yang tidak boleh dibatalkan oleh satu bit terbalik di buffer dataloader.

03

NVMe yang bisa mengimbangi

Satu hingga empat terabyte NVMe Gen4 lokal, dicerminkan. Dataset dialirkan dari mesin itu sendiri dan bukan melalui volume jaringan yang dibaca orang lain.

04

Port 40 gigabit

Menarik dataset multi-terabyte seharusnya memakan waktu satu malam. Penggunaan wajar pada port 40 gigabit adalah 250 terabyte per bulan, dipublikasikan di halaman harga.

05

Konsol out-of-band

Serial dan VNC melalui tunnel terautentikasi, sudah termasuk. Ketika instalasi driver salah pada tengah malam, Anda masih dapat menjangkau mesin, yang merupakan alasan utama keberadaannya.

Kartu di-pass-through, jadi driver diinstal di dalam instance Anda seperti mesin lain. Tidak ada apa pun di host yang menyentuh framework Anda, dan reboot tidak menegosiasikan ulang apa pun.

05

Di mana kartu-kartu berada

Amsterdam, Frankfurt, London, New York, Dallas, Los Angeles, Singapura, dan Tokyo. Itulah lantai dengan kepadatan daya dan pendinginan yang mampu menjalankan kartu pada beban penuh secara terus-menerus, bukan dalam ledakan yang sopan.

Delapan situs di enam negara. GPU membutuhkan daya dan pendinginan, bukan kode pos.

Frankfurt adalah lantai GPU tersibuk yang kami operasikan dan menerima kartu baru lebih dulu. Dallas adalah tempat termudah untuk mendapatkan kapasitas dalam waktu singkat, karena daya di sana murah dan lantainya besar. Los Angeles membawa kartu tetapi sering kosong, jadi pesan lebih awal jika rute ke arah barat ke Asia yang Anda beli.

Stok benar-benar bergerak pada lini ini. Kartu yang tampak tersedia pada siang hari mungkin tidak ada di malam hari, dan kami lebih suka menampilkan label kehabisan stok yang akurat daripada menerima pesanan yang tidak dapat kami penuhi minggu ini.

SitusCatatanPenggunaan umum
AmsterdamSitus terpadat di armada, semuanya dikirim ke sini terlebih dahuluInferensi Eropa dengan latensi rendah ke sebagian besar benua
FrankfurtLantai GPU tersibuk, pertama menerima kartu baruPelatihan dan penyesuaian halus di mana kapasitas lebih penting daripada milidetik terakhir
LondonLatensi transatlantik terendah di EropaMelayani pengguna di kedua sisi Atlantik dari satu tempat
New YorkJangkar pantai timur, rangkaian produk lengkapInferensi Amerika Utara
DallasDaya murah, lantai luas, kapasitas termudahPekerjaan batch panjang dan apa pun yang sensitif terhadap harga
Los AngelesRute arah barat terbaik yang kami miliki di luar AsiaMelayani lingkar Pasifik dari Amerika Utara
SingapuraPilihan standar untuk Asia TenggaraInferensi regional
TokyoWaktu perjalanan pulang-pergi paling stabil di kawasanLalu lintas Jepang dan Korea yang sensitif terhadap latensi
06

Pekerjaan panjang, dan cara untuk tidak kehilangannya

Penyesuaian halus selama 48 jam adalah taruhan bahwa tidak ada yang salah selama dua hari. Strukturkan pekerjaan sehingga kehilangan taruhan menghabiskan satu jam, bukan akhir pekan.

Checkpoint. Kami akan tetap mengatakannya setelah Anda mendengarnya seratus kali.

  1. 01

    Checkpoint ke NVMe lokal, sering

    Setiap beberapa ratus langkah, ke disk lokal, karena cukup cepat sehingga biayanya dapat diabaikan. Pekerjaan yang tidak dapat dilanjutkan adalah pekerjaan yang pada akhirnya akan Anda jalankan dua kali.

  2. 02

    Salin checkpoint dari mesin

    NVMe lokal dicerminkan, tidak abadi. Cadangan off-node menulis ke kota yang berbeda setiap malam, dan itu adalah asuransi termurah di halaman ini.

  3. 03

    Snapshot sebelum menyentuh driver

    Peningkatan driver dan framework adalah penyebab utama lingkungan yang berfungsi menjadi tidak berfungsi. Snapshot membutuhkan detik untuk dibuat dan detik untuk dipulihkan.

  4. 04

    Pantau suhu dan clock, bukan hanya loss

    Kartu akan melakukan throttle saat ruangan sedang tidak bersahabat. Jika throughput turun tanpa perubahan pada kode Anda, lihat angka clock sebelum menulis ulang dataloader.

  5. 05

    Tanyakan sebelum menambah skala secara horizontal

    Jika langkah selanjutnya adalah empat atau delapan kartu, beri tahu support apa yang ingin Anda capai. Terkadang jawabannya adalah mesin bare-metal, dan kadang-kadang jawabannya adalah kami bukan pemasok yang tepat.

07

Saat perangkat keras mengalami kegagalan

GPU biasanya menurun secara bertahap daripada langsung mati: clock yang turun, error memori yang terkoreksi pada kartu, atau pekerjaan yang tiba-tiba berjalan sepertiga lebih lambat tanpa alasan yang dapat Anda temukan dalam kode.

Kartu gagal dengan cara yang berbeda dari disk. Lebih lambat, dan dengan lebih banyak peringatan.

Monitoring kami memantau suhu kartu, perilaku clock, dan penghitung error di setiap host. Saat kartu mulai berperilaku tidak normal, kami menghubungi Anda sebelum kartu berhenti bekerja, dan kami menjadwalkan penggantian di sekitar pekerjaan Anda, bukan di tengah-tengahnya. Jika kartu gagal total, instance Anda dibangun ulang di host lain di situs yang sama dengan volume dan alamat yang tetap utuh.

Pemulihan di lini ini lebih lambat daripada di tempat lain dalam armada, dan perlu kami jelaskan secara terus terang alasannya: satu terabyte dataset dan model yang menetap membutuhkan waktu beberapa menit untuk dipindahkan dan dimuat ulang. Rencanakan satu jam daripada lima belas menit, dan simpan checkpoint di tempat selain mesin yang sedang bermasalah.

01

Peringatan sebelum kegagalan, jika memungkinkan

Penghitung error dan telemetri clock dibaca secara berkelanjutan. Sebagian besar penggantian kartu terjadi dalam jendela yang kami sepakati dengan pelanggan sebelumnya.

02

Volume dan alamat tetap utuh

Proses rebuild membawa isi NVMe dan alamat IP Anda. Tidak ada yang perlu diubah dalam DNS atau sertifikat Anda.

03

Kredit otomatis

Uptime kontraktual 99.99% yang sama berlaku di sini seperti di tempat lain, dan kredit diberikan tanpa formulir klaim.

08

Pertanyaan tentang lini ini

Perangkat fisik terikat ke instance Anda melalui tautan enam belas jalur penuh. Tidak ada partisi vGPU, tidak ada time-slicing, dan tidak ada penyewa lain di atasnya. Daftar perangkat Anda menampilkan satu kartu karena memang ada satu kartu.

Tidak. Kartu bersifat bulanan, dan komitmen terpendek adalah satu bulan. Jika beban kerja Anda benar-benar bersifat bursty, penyedia dengan sistem metered akan lebih murah, dan tidak ada versi percakapan ini di mana kami berpura-pura sebaliknya.

Tidak ada, kecuali Anda memintanya. Image dikirim bersih dan driver dipasang di dalam instance Anda, karena separuh pelanggan GPU kami memiliki pandangan kuat tentang versi, dan separuh lainnya memiliki container yang membawa driver sendiri.

Tidak. Keduanya berada di host yang sama dan domain NUMA yang sama, dan berkomunikasi melalui PCIe. Untuk pekerjaan data-paralel dengan pertukaran gradien yang sederhana, ini cukup. Untuk apa pun yang mengasumsikan fabric kartu-ke-kartu dengan bandwidth tinggi, ini tidak cukup, dan Anda harus menyesuaikan ekspektasi Anda.

Tidak. Passthrough memerlukan host yang dibangun khusus untuk itu, dengan topologi PCIe dan alokasi daya yang memadai. Pindah ke lini ini berarti instance baru dan penyalinan data.

Volume akan dihapus dan kartu kembali ke pool. Bawa checkpoint Anda sebelum masa berakhir, karena instance yang dibatalkan benar-benar hilang, bukan disimpan di suatu tempat menunggu Anda berubah pikiran.

Siap saat Anda siap

Ambil seluruh kartu

Periksa dulu aritmatika memori, pilih situs dengan kapasitas yang tersedia, dan bayar dengan koin. Akses root tiba dalam waktu kurang dari satu menit, keputusan driver tetap ada di tangan Anda, dan tujuh hari pertama dapat dikembalikan tanpa alasan.