Karta, a nie jej wycinek
Współdzielone GPU to niczyja sprawa, dopóki czyjaś praca nie skończy się przed twoją. Każda karta w tej linii jest przepuszczona do jednej instancji przez pełne łącze 16-liniowe i pozostaje tam, dopóki nie anulujesz, bezczynna lub nie.
A shared GPU is someone else’s job finishing before yours starts. Every card in this line is passed straight through to a single instance and stays there until you cancel.
| Plan | Dedykowane rdzenie | Pamięć | Pamięć NVMe | Grafika | Prędkość portu | Cena | |
|---|---|---|---|---|---|---|---|
| G-ADA Inference and light training | 8 | 64 GB | 1 TB | 1 × RTX 4000 Ada · 20 GB | 40 Gbit/s | €239.00 /mc | Konfiguruj |
| G-L40SNajczęściej wybierane 48 GB of VRAM, undivided | 16 | 128 GB | 2 TB | 1 × L40S · 48 GB | 40 Gbit/s | €749.00 /mc | Konfiguruj |
| G-L40S×2 Two cards, one NUMA node | 32 | 256 GB | 4 TB | 2 × L40S · 96 GB | 40 Gbit/s | €1420.00 /mc | Konfiguruj |
Ceny nie zawierają VAT, jeśli ma zastosowanie. Ruch: Nielimitowany, do uczciwego użytku.
EPYC 9354P host · PCIe 4.0 x16 passthrough · no vGPU time-slicing
Trzydzieści cztery miasta, dwadzieścia dziewięć krajów
Wartości latencji to zmierzone mediany z naszych własnych sond, a nie broszury sprzedawców. Zmieniają się; strona aktualizuje się, gdy się zmieniają.
Przepuszczanie i dlaczego to ważne
Większość tanich mocy GPU to ułamek karty rozdawany w kolejce. Liczba na stronie produktu to pamięć karty, nie twoja, a przepustowość, którą zmierzysz, zależy od tego, kto jeszcze obudził się dziś rano.
Bez vGPU, bez dzielenia czasu, bez schedulera między tobą a krzemem.
Tutaj karta jest powiązana z twoją instancją na poziomie hiperwizora przez łącze PCIe 4.0 x16. Całe urządzenie jest twoje: cała pamięć, wszystkie jednostki obliczeniowe, pełne pasmo silnika kopiowania. Nic nie jest partycjonowane, nic nie jest w kolejce, a żaden inny najemca nie pojawia się na liście twoich urządzeń.
Praktyczną konsekwencją jest to, że twój benchmark dziś wieczorem będzie zgodny z twoim benchmarkiem z zeszłego wtorku. Uruchomienia dostrajania, które trwają dwa dni, kończą się w czasie, który przewidziałeś w pierwszej godzinie. Praca interaktywna pozostaje interaktywna, bo przed twoją nie ma cudzego zadania wsadowego.
Cały VRAM, przez cały czas
Czterdzieści osiem gigabajtów na L40S, dwadzieścia na RTX 4000 Ada, a żadna część nie jest zarezerwowana na partycję hiperwizora. To, co ma karta, jest tym, co twój proces może zaadresować.
Bezczynność nie kosztuje nic dodatkowo
Karta jest twoja na miesiąc, a nie na sekundę. Zostaw model w pamięci na trzy tygodnie między eksperymentami, a nikt go nie odbierze, gdy śpisz.
Dwie karty, jeden host
Wariant z dwiema kartami umieszcza oba urządzenia w tej samej domenie NUMA tego samego hosta. Komunikują się przez PCIe, a nie przez łącze karta-karta, co warto wiedzieć, zanim zaplanujesz topologię treningu.
Twój własny stos
Wręczamy Ci maszynę z kartą w środku i nie wchodzimy w drogę. Sterowniki, środowisko uruchomieniowe kontenerów, wersje frameworków i jądro należą do Ciebie. Nie ma warstwy zarządzanej, która ma opinie na temat Twojego Pythona.
Do czego nadają się te karty
Obie karty są klasy workstation, a nie szczytem klastra treningowego, i uczciwe pozycjonowanie wynika z tego.
Inferencja, fine-tuning, renderowanie i obliczenia wsadowe. W tej kolejności.
Jeśli Twój model mieści się w czterdziestu ośmiu gigabajtach, L40S będzie go serwować kompetentnie tak długo, jak długo będziesz za to płacić. Jeśli się nie mieści, żaden entuzjazm tego nie zmieni, a następnym uczciwym krokiem jest kwantyzacja, podział na tier z dwiema kartami lub zupełnie inna klasa maszyny.
| Obciążenie | Która karta | Rzeczywiste ograniczenie |
|---|---|---|
| Serwowanie skwantowanego modelu prawdziwym użytkownikom | RTX 4000 Ada | Pamięć, potem współbieżność żądań |
| Serwowanie modelu średniej wielkości z pełną precyzją | L40S | Czterdzieści osiem gigabajtów to sufit, który o tym decyduje |
| Fine-tuning z adapterami | L40S | VRAM podczas przejścia wstecznego, a nie surowa przepustowość |
| Pełny fine-tuning dużego modelu | Dwie L40S lub gdzie indziej | Przepustowość między kartami przez PCIe staje się ograniczeniem |
| Renderowanie wsadowe i kodowanie wideo | Dowolna | Dysk i sieć znacznie częściej niż karta |
| Symulacje numeryczne w podwójnej precyzji | Żadna, zwykle | To nie są części do podwójnej precyzji. Weź rdzenie EPYC |
Kto nie powinien tego kupować
Pojemność GPU przyciąga optymistyczne szacowanie bardziej niż jakikolwiek inny produkt, który sprzedajemy. Trzy grupy ludzi powinny przejść obok tej linii.
Najbardziej użyteczną rzeczą, jaką możemy powiedzieć niektórym klientom, jest to, że jesteśmy złym sklepem.
Trenujesz coś ogromnego od zera
Trenowanie wielowęzłowe z szybkim łączem między hostami to nie jest to. Dwie karty przez PCIe na jednym hoście to nasz sufit, a udawanie inaczej zmarnuje tygodnie Twojego czasu.
Chcesz rozliczania co sekundę
Karty są wynajmowane miesięcznie. Jeśli Twoje użycie to naprawdę dwadzieścia minut tygodniowo, platforma z pomiarem zużycia będzie kosztować Cię mniej niż my, i wolelibyśmy to powiedzieć teraz.
Twój model się nie mieści
Dziewięćdziesiąt sześć gigabajtów na dwóch kartach to maksimum, które można tu zaadresować. Oblicz arytmetykę pamięci dla wag, aktywacji i stanu optymalizatora przed zamówieniem, a nie po.
Potrzebujesz podwójnej precyzji
To części do pojedynczej i mieszanej precyzji. Kody naukowe, które wymagają przepustowości FP64, będą działać szybciej na czterdziestu ośmiu rdzeniach EPYC niż na którejkolwiek z kart.
Chcesz, żebyśmy zarządzali stosem
Nie utrzymujemy Twojego sterownika, wersji CUDA ani macierzy frameworków. Dodatek do utwardzania obejmuje bazowy system operacyjny i na tym się kończy.
Host wokół karty
Wyposzczona karta GPU to drogi grzejnik. Host ma znaczenie tak samo jak karta, i to tam większość tanich ofert GPU po cichu tnie koszty.
EPYC 9354P, pamięć ECC, NVMe lokalny dla maszyny, port czterdzieści gigabitów.
Rdzenie, które ją nakarmią
Osiem do trzydziestu dwóch dedykowanych rdzeni EPYC w zależności od tieru, przypiętych do tej samej domeny NUMA co karta. Ładowanie danych i przetwarzanie wstępne to zwykły powód, dla którego pętla treningowa utyka, a to praca CPU.
Pamięć ECC na hoście
Rejestrowana DDR5-4800, od sześćdziesięciu czterech do dwustu pięćdziesięciu sześciu gigabajtów. Czterdziestoośmiogodzinne zadanie to dokładnie coś, co nie powinno być zepsute przez jeden odwrócony bit w buforze dataloadera.
NVMe, który nadąża
Od jednego do czterech terabajtów lokalnego dysku Gen4 NVMe, w lustrze. Dane są przesyłane z samej maszyny, a nie przez wolumin sieciowy, z którego korzysta ktoś inny.
Port czterdzieści gigabitów
Pobranie wieloterabajtowego zestawu danych powinno zająć wieczór. Dozwolony użytek na porcie czterdzieści gigabitów to dwieście pięćdziesiąt terabajtów miesięcznie, opublikowane na stronie z cenami.
Konsola out-of-band
Seryjna i VNC przez uwierzytelniony tunel, w cenie. Gdy instalacja sterownika nie powiedzie się o północy, nadal możesz dotrzeć do maszyny, co jest całym powodem jej istnienia.
Karta jest przekazywana w całości, więc sterownik jest instalowany wewnątrz Twojej instancji jak na każdej innej maszynie. Nic na hoście nie dotyka Twojej struktury, a restart nie negocjuje niczego ponownie.
Gdzie są karty
Amsterdam, Frankfurt, Londyn, Nowy Jork, Dallas, Los Angeles, Singapur i Tokio. To są piętra z gęstością zasilania i chłodzeniem, aby działać na kartach przy pełnym obciążeniu w sposób ciągły, a nie w grzecznych seriach.
Osiem lokalizacji w sześciu krajach. Karty GPU potrzebują zasilania i chłodzenia, nie kodów pocztowych.
Frankfurt to najbardziej obciążone piętro GPU, jakie prowadzimy, i otrzymuje nowe karty jako pierwsze. Dallas to najłatwiejsze miejsce do uzyskania pojemności w krótkim czasie, ponieważ energia jest tam tania, a piętro duże. Los Angeles ma karty, ale często jest ich mało, więc zamawiaj wcześniej, jeśli kupujesz trasę na zachód do Azji.
Zapasy naprawdę się tu zmieniają. Karta, która jest dostępna w południe, może nie być dostępna wieczorem, i wolelibyśmy pokazać Ci dokładną etykietę „wyprzedane”, niż przyjąć zamówienie, którego nie możemy zrealizować w tym tygodniu.
| Lokalizacja | Uwagi | Typowe zastosowanie |
|---|---|---|
| Amsterdam | Najgęstsza lokalizacja we flocie, wszystko trafia tu najpierw | Inferencja europejska z niskim opóźnieniem do większości kontynentu |
| Frankfurt | Najbardziej obciążone piętro GPU, pierwsze otrzymujące nowe karty | Trenowanie i dostrajanie, gdzie pojemność ma znaczenie bardziej niż ostatnia milisekunda |
| Londyn | Najniższe opóźnienie transatlantyckie w Europie | Obsługa użytkowników po obu stronach Atlantyku z jednego miejsca |
| Nowy Jork | Kotwica wschodniego wybrzeża, pełna gama produktów | Inferencja północnoamerykańska |
| Dallas | Tania energia, duże piętro, najłatwiejsza pojemność | Długie zadania wsadowe i wszystko wrażliwe na cenę |
| Los Angeles | Najlepsze trasy na zachód, jakie mamy poza Azją | Obsługa regionu Pacyfiku z Ameryki Północnej |
| Singapur | Domyślny wybór dla Azji Południowo-Wschodniej | Inferencja regionalna |
| Tokio | Najbardziej stabilny czas podróży w obie strony w regionie | Ruch japoński i koreański wrażliwy na opóźnienia |
Długie zadania i jak nie stracić żadnego
Czterdziestoośmiogodzinne dostrajanie to zakład, że nic nie pójdzie źle przez dwa dni. Zaplanuj zadanie tak, aby utrata tego zakładu kosztowała Cię godzinę, a nie weekend.
Punkt kontrolny. Powtórzymy to, nawet po tym, jak usłyszysz to sto razy.
- 01
Punkt kontrolny na lokalnym dysku NVMe, często
Co kilkaset kroków, na lokalny dysk, ponieważ jest na tyle szybki, że koszt jest pomijalny. Zadanie, które nie może zostać wznowione, to zadanie, które ostatecznie uruchomisz dwukrotnie.
- 02
Kopiuj punkty kontrolne poza maszynę
Lokalny dysk NVMe jest w lustrze, a nie nieśmiertelny. Backup pozawęzłowy zapisuje do innego miasta co noc, i to najtańsze ubezpieczenie na tej stronie.
- 03
Zrób migawkę, zanim dotkniesz sterownika
Aktualizacje sterowników i frameworków są główną przyczyną, dla której działające środowisko staje się niedziałającym. Migawka zajmuje sekundy, aby ją zrobić, i sekundy, aby przywrócić.
- 04
Obserwuj temperaturę i zegary, nie tylko straty
Karty throttlują, gdy pomieszczenie ma zły dzień. Jeśli przepustowość spada bez zmiany kodu, spójrz na wartości zegarów, zanim przepiszesz dataloader.
- 05
Zapytaj, zanim skalujesz w bok
Jeśli następnym krokiem są cztery lub osiem kart, powiedz wsparciu, co próbujesz osiągnąć. Czasami odpowiedzią jest maszyna bare-metal, a czasami to, że nie jesteśmy właściwym dostawcą.
Gdy sprzęt ulega awarii
GPU zwykle degradują się, a nie umierają: spadające zegary, skorygowane błędy pamięci na karcie, zadanie, które nagle działa o jedną trzecią wolniej bez widocznego powodu w kodzie.
Karty zawodzą inaczej niż dyski. Wolniej i z większym ostrzeżeniem.
Nasz monitoring śledzi temperaturę kart, zachowanie zegarów i liczniki błędów na każdym hoście. Gdy karta zaczyna zachowywać się nieprawidłowo, kontaktujemy się z Tobą, zanim przestanie działać, i planujemy wymianę wokół Twojego zadania, a nie w jego trakcie. W przypadku całkowitej awarii karty Twoja instancja jest odtwarzana na innym hoście w tej samej lokalizacji, z zachowaniem wolumenów i adresów.
Odzyskiwanie w tej linii jest wolniejsze niż gdzie indziej we flocie i warto jasno powiedzieć dlaczego: terabajt danych i model rezydentny wymagają realnych minut na przeniesienie i ponowne załadowanie. Planuj godzinę, a nie piętnaście minut, i trzymaj checkpointy w miejscu innym niż maszyna, która się pali.
Ostrzeżenie przed awarią, o ile to możliwe
Liczniki błędów i telemetria zegarów są odczytywane w sposób ciągły. Większość wymian kart odbywa się w oknie uzgodnionym z klientem z wyprzedzeniem.
Wolumeny i adresy przetrwają
Odtworzenie przenosi zawartość NVMe i adresy IP. Nic w Twoim DNS ani w certyfikatach nie musi się zmieniać.
Kredyty są automatyczne
Ta sama umowna dostępność 99.99% obowiązuje tutaj jak wszędzie indziej, a kredyt trafia na konto bez formularza reklamacyjnego.
Pytania o tę serię
Fizyczne urządzenie jest przypisane do Twojej instancji przez pełne łącze szesnastu linii. Nie ma partycjonowania vGPU, żadnego time-slicingu ani innego dzierżawcy. Lista urządzeń pokazuje jedną kartę, bo jest jedna karta.
Nie. Karty są miesięczne, a najkrótszy okres zobowiązania to jeden miesiąc. Jeśli Twoje obciążenie jest rzeczywiście impulsowe, tańszy będzie dostawca z rozliczeniem metered, i nie ma wersji tej rozmowy, w której udajemy, że jest inaczej.
Żaden, chyba że poprosisz. Obrazy są czyste, a sterownik instalowany jest wewnątrz instancji, ponieważ połowa naszych klientów GPU ma zdecydowane poglądy na wersje, a druga połowa ma kontener, który niesie własny.
Nie. Siedzą na tym samym hoście i w tej samej domenie NUMA, a komunikują się przez PCIe. W przypadku pracy data-parallel z umiarkowaną wymianą gradientów to wystarczy. W przypadku czegokolwiek, co zakłada szybką sieć między kartami, nie wystarczy, i powinieneś odpowiednio skalować oczekiwania.
Nie. Passthrough wymaga, aby host był do tego zbudowany, z topologią PCIe i budżetem mocy na miejscu. Przejście na tę linię oznacza nową instancję i kopię danych.
Wolumen jest kasowany, a karta wraca do puli. Zdejmij checkpointy przed końcem okresu, ponieważ anulowana instancja naprawdę znika, a nie czeka gdzieś, aż zmienisz zdanie.
Weź całą kartę
Najpierw sprawdź arytmetykę pamięci, wybierz lokalizację z odpowiednią pojemnością i zapłać w kryptowalucie. Dostęp root w mniej niż minutę, decyzja o sterowniku należy do Ciebie, a pierwsze siedem dni jest zwrotne bez podania powodu.