Linia trzecia z pięciu

Karta, a nie jej wycinek

Współdzielone GPU to niczyja sprawa, dopóki czyjaś praca nie skończy się przed twoją. Każda karta w tej linii jest przepuszczona do jednej instancji przez pełne łącze 16-liniowe i pozostaje tam, dopóki nie anulujesz, bezczynna lub nie.

Flota
od€239
WdrożeniePoniżej minuty
Dostępne w8
RuchNielimitowany, do uczciwego użytku

A shared GPU is someone else’s job finishing before yours starts. Every card in this line is passed straight through to a single instance and stays there until you cancel.

Cena
PlanDedykowane rdzeniePamięćPamięć NVMeGrafikaPrędkość portuCena
G-ADA
Inference and light training
864 GB1 TB1 × RTX 4000 Ada · 20 GB40 Gbit/s€239.00
/mc
Konfiguruj
G-L40SNajczęściej wybierane
48 GB of VRAM, undivided
16128 GB2 TB1 × L40S · 48 GB40 Gbit/s€749.00
/mc
Konfiguruj
G-L40S×2
Two cards, one NUMA node
32256 GB4 TB2 × L40S · 96 GB40 Gbit/s€1420.00
/mc
Konfiguruj

Ceny nie zawierają VAT, jeśli ma zastosowanie. Ruch: Nielimitowany, do uczciwego użytku.

EPYC 9354P host · PCIe 4.0 x16 passthrough · no vGPU time-slicing

00

Trzydzieści cztery miasta, dwadzieścia dziewięć krajów

Wartości latencji to zmierzone mediany z naszych własnych sond, a nie broszury sprzedawców. Zmieniają się; strona aktualizuje się, gdy się zmieniają.

01

Przepuszczanie i dlaczego to ważne

Większość tanich mocy GPU to ułamek karty rozdawany w kolejce. Liczba na stronie produktu to pamięć karty, nie twoja, a przepustowość, którą zmierzysz, zależy od tego, kto jeszcze obudził się dziś rano.

Bez vGPU, bez dzielenia czasu, bez schedulera między tobą a krzemem.

Tutaj karta jest powiązana z twoją instancją na poziomie hiperwizora przez łącze PCIe 4.0 x16. Całe urządzenie jest twoje: cała pamięć, wszystkie jednostki obliczeniowe, pełne pasmo silnika kopiowania. Nic nie jest partycjonowane, nic nie jest w kolejce, a żaden inny najemca nie pojawia się na liście twoich urządzeń.

Praktyczną konsekwencją jest to, że twój benchmark dziś wieczorem będzie zgodny z twoim benchmarkiem z zeszłego wtorku. Uruchomienia dostrajania, które trwają dwa dni, kończą się w czasie, który przewidziałeś w pierwszej godzinie. Praca interaktywna pozostaje interaktywna, bo przed twoją nie ma cudzego zadania wsadowego.

01

Cały VRAM, przez cały czas

Czterdzieści osiem gigabajtów na L40S, dwadzieścia na RTX 4000 Ada, a żadna część nie jest zarezerwowana na partycję hiperwizora. To, co ma karta, jest tym, co twój proces może zaadresować.

02

Bezczynność nie kosztuje nic dodatkowo

Karta jest twoja na miesiąc, a nie na sekundę. Zostaw model w pamięci na trzy tygodnie między eksperymentami, a nikt go nie odbierze, gdy śpisz.

03

Dwie karty, jeden host

Wariant z dwiema kartami umieszcza oba urządzenia w tej samej domenie NUMA tego samego hosta. Komunikują się przez PCIe, a nie przez łącze karta-karta, co warto wiedzieć, zanim zaplanujesz topologię treningu.

04

Twój własny stos

Wręczamy Ci maszynę z kartą w środku i nie wchodzimy w drogę. Sterowniki, środowisko uruchomieniowe kontenerów, wersje frameworków i jądro należą do Ciebie. Nie ma warstwy zarządzanej, która ma opinie na temat Twojego Pythona.

02

Do czego nadają się te karty

Obie karty są klasy workstation, a nie szczytem klastra treningowego, i uczciwe pozycjonowanie wynika z tego.

Inferencja, fine-tuning, renderowanie i obliczenia wsadowe. W tej kolejności.

Jeśli Twój model mieści się w czterdziestu ośmiu gigabajtach, L40S będzie go serwować kompetentnie tak długo, jak długo będziesz za to płacić. Jeśli się nie mieści, żaden entuzjazm tego nie zmieni, a następnym uczciwym krokiem jest kwantyzacja, podział na tier z dwiema kartami lub zupełnie inna klasa maszyny.

ObciążenieKtóra kartaRzeczywiste ograniczenie
Serwowanie skwantowanego modelu prawdziwym użytkownikomRTX 4000 AdaPamięć, potem współbieżność żądań
Serwowanie modelu średniej wielkości z pełną precyzjąL40SCzterdzieści osiem gigabajtów to sufit, który o tym decyduje
Fine-tuning z adapteramiL40SVRAM podczas przejścia wstecznego, a nie surowa przepustowość
Pełny fine-tuning dużego modeluDwie L40S lub gdzie indziejPrzepustowość między kartami przez PCIe staje się ograniczeniem
Renderowanie wsadowe i kodowanie wideoDowolnaDysk i sieć znacznie częściej niż karta
Symulacje numeryczne w podwójnej precyzjiŻadna, zwykleTo nie są części do podwójnej precyzji. Weź rdzenie EPYC
03

Kto nie powinien tego kupować

Pojemność GPU przyciąga optymistyczne szacowanie bardziej niż jakikolwiek inny produkt, który sprzedajemy. Trzy grupy ludzi powinny przejść obok tej linii.

Najbardziej użyteczną rzeczą, jaką możemy powiedzieć niektórym klientom, jest to, że jesteśmy złym sklepem.

01

Trenujesz coś ogromnego od zera

Trenowanie wielowęzłowe z szybkim łączem między hostami to nie jest to. Dwie karty przez PCIe na jednym hoście to nasz sufit, a udawanie inaczej zmarnuje tygodnie Twojego czasu.

02

Chcesz rozliczania co sekundę

Karty są wynajmowane miesięcznie. Jeśli Twoje użycie to naprawdę dwadzieścia minut tygodniowo, platforma z pomiarem zużycia będzie kosztować Cię mniej niż my, i wolelibyśmy to powiedzieć teraz.

03

Twój model się nie mieści

Dziewięćdziesiąt sześć gigabajtów na dwóch kartach to maksimum, które można tu zaadresować. Oblicz arytmetykę pamięci dla wag, aktywacji i stanu optymalizatora przed zamówieniem, a nie po.

04

Potrzebujesz podwójnej precyzji

To części do pojedynczej i mieszanej precyzji. Kody naukowe, które wymagają przepustowości FP64, będą działać szybciej na czterdziestu ośmiu rdzeniach EPYC niż na którejkolwiek z kart.

05

Chcesz, żebyśmy zarządzali stosem

Nie utrzymujemy Twojego sterownika, wersji CUDA ani macierzy frameworków. Dodatek do utwardzania obejmuje bazowy system operacyjny i na tym się kończy.

04

Host wokół karty

Wyposzczona karta GPU to drogi grzejnik. Host ma znaczenie tak samo jak karta, i to tam większość tanich ofert GPU po cichu tnie koszty.

EPYC 9354P, pamięć ECC, NVMe lokalny dla maszyny, port czterdzieści gigabitów.

01

Rdzenie, które ją nakarmią

Osiem do trzydziestu dwóch dedykowanych rdzeni EPYC w zależności od tieru, przypiętych do tej samej domeny NUMA co karta. Ładowanie danych i przetwarzanie wstępne to zwykły powód, dla którego pętla treningowa utyka, a to praca CPU.

02

Pamięć ECC na hoście

Rejestrowana DDR5-4800, od sześćdziesięciu czterech do dwustu pięćdziesięciu sześciu gigabajtów. Czterdziestoośmiogodzinne zadanie to dokładnie coś, co nie powinno być zepsute przez jeden odwrócony bit w buforze dataloadera.

03

NVMe, który nadąża

Od jednego do czterech terabajtów lokalnego dysku Gen4 NVMe, w lustrze. Dane są przesyłane z samej maszyny, a nie przez wolumin sieciowy, z którego korzysta ktoś inny.

04

Port czterdzieści gigabitów

Pobranie wieloterabajtowego zestawu danych powinno zająć wieczór. Dozwolony użytek na porcie czterdzieści gigabitów to dwieście pięćdziesiąt terabajtów miesięcznie, opublikowane na stronie z cenami.

05

Konsola out-of-band

Seryjna i VNC przez uwierzytelniony tunel, w cenie. Gdy instalacja sterownika nie powiedzie się o północy, nadal możesz dotrzeć do maszyny, co jest całym powodem jej istnienia.

Karta jest przekazywana w całości, więc sterownik jest instalowany wewnątrz Twojej instancji jak na każdej innej maszynie. Nic na hoście nie dotyka Twojej struktury, a restart nie negocjuje niczego ponownie.

05

Gdzie są karty

Amsterdam, Frankfurt, Londyn, Nowy Jork, Dallas, Los Angeles, Singapur i Tokio. To są piętra z gęstością zasilania i chłodzeniem, aby działać na kartach przy pełnym obciążeniu w sposób ciągły, a nie w grzecznych seriach.

Osiem lokalizacji w sześciu krajach. Karty GPU potrzebują zasilania i chłodzenia, nie kodów pocztowych.

Frankfurt to najbardziej obciążone piętro GPU, jakie prowadzimy, i otrzymuje nowe karty jako pierwsze. Dallas to najłatwiejsze miejsce do uzyskania pojemności w krótkim czasie, ponieważ energia jest tam tania, a piętro duże. Los Angeles ma karty, ale często jest ich mało, więc zamawiaj wcześniej, jeśli kupujesz trasę na zachód do Azji.

Zapasy naprawdę się tu zmieniają. Karta, która jest dostępna w południe, może nie być dostępna wieczorem, i wolelibyśmy pokazać Ci dokładną etykietę „wyprzedane”, niż przyjąć zamówienie, którego nie możemy zrealizować w tym tygodniu.

LokalizacjaUwagiTypowe zastosowanie
AmsterdamNajgęstsza lokalizacja we flocie, wszystko trafia tu najpierwInferencja europejska z niskim opóźnieniem do większości kontynentu
FrankfurtNajbardziej obciążone piętro GPU, pierwsze otrzymujące nowe kartyTrenowanie i dostrajanie, gdzie pojemność ma znaczenie bardziej niż ostatnia milisekunda
LondynNajniższe opóźnienie transatlantyckie w EuropieObsługa użytkowników po obu stronach Atlantyku z jednego miejsca
Nowy JorkKotwica wschodniego wybrzeża, pełna gama produktówInferencja północnoamerykańska
DallasTania energia, duże piętro, najłatwiejsza pojemnośćDługie zadania wsadowe i wszystko wrażliwe na cenę
Los AngelesNajlepsze trasy na zachód, jakie mamy poza AzjąObsługa regionu Pacyfiku z Ameryki Północnej
SingapurDomyślny wybór dla Azji Południowo-WschodniejInferencja regionalna
TokioNajbardziej stabilny czas podróży w obie strony w regionieRuch japoński i koreański wrażliwy na opóźnienia
06

Długie zadania i jak nie stracić żadnego

Czterdziestoośmiogodzinne dostrajanie to zakład, że nic nie pójdzie źle przez dwa dni. Zaplanuj zadanie tak, aby utrata tego zakładu kosztowała Cię godzinę, a nie weekend.

Punkt kontrolny. Powtórzymy to, nawet po tym, jak usłyszysz to sto razy.

  1. 01

    Punkt kontrolny na lokalnym dysku NVMe, często

    Co kilkaset kroków, na lokalny dysk, ponieważ jest na tyle szybki, że koszt jest pomijalny. Zadanie, które nie może zostać wznowione, to zadanie, które ostatecznie uruchomisz dwukrotnie.

  2. 02

    Kopiuj punkty kontrolne poza maszynę

    Lokalny dysk NVMe jest w lustrze, a nie nieśmiertelny. Backup pozawęzłowy zapisuje do innego miasta co noc, i to najtańsze ubezpieczenie na tej stronie.

  3. 03

    Zrób migawkę, zanim dotkniesz sterownika

    Aktualizacje sterowników i frameworków są główną przyczyną, dla której działające środowisko staje się niedziałającym. Migawka zajmuje sekundy, aby ją zrobić, i sekundy, aby przywrócić.

  4. 04

    Obserwuj temperaturę i zegary, nie tylko straty

    Karty throttlują, gdy pomieszczenie ma zły dzień. Jeśli przepustowość spada bez zmiany kodu, spójrz na wartości zegarów, zanim przepiszesz dataloader.

  5. 05

    Zapytaj, zanim skalujesz w bok

    Jeśli następnym krokiem są cztery lub osiem kart, powiedz wsparciu, co próbujesz osiągnąć. Czasami odpowiedzią jest maszyna bare-metal, a czasami to, że nie jesteśmy właściwym dostawcą.

07

Gdy sprzęt ulega awarii

GPU zwykle degradują się, a nie umierają: spadające zegary, skorygowane błędy pamięci na karcie, zadanie, które nagle działa o jedną trzecią wolniej bez widocznego powodu w kodzie.

Karty zawodzą inaczej niż dyski. Wolniej i z większym ostrzeżeniem.

Nasz monitoring śledzi temperaturę kart, zachowanie zegarów i liczniki błędów na każdym hoście. Gdy karta zaczyna zachowywać się nieprawidłowo, kontaktujemy się z Tobą, zanim przestanie działać, i planujemy wymianę wokół Twojego zadania, a nie w jego trakcie. W przypadku całkowitej awarii karty Twoja instancja jest odtwarzana na innym hoście w tej samej lokalizacji, z zachowaniem wolumenów i adresów.

Odzyskiwanie w tej linii jest wolniejsze niż gdzie indziej we flocie i warto jasno powiedzieć dlaczego: terabajt danych i model rezydentny wymagają realnych minut na przeniesienie i ponowne załadowanie. Planuj godzinę, a nie piętnaście minut, i trzymaj checkpointy w miejscu innym niż maszyna, która się pali.

01

Ostrzeżenie przed awarią, o ile to możliwe

Liczniki błędów i telemetria zegarów są odczytywane w sposób ciągły. Większość wymian kart odbywa się w oknie uzgodnionym z klientem z wyprzedzeniem.

02

Wolumeny i adresy przetrwają

Odtworzenie przenosi zawartość NVMe i adresy IP. Nic w Twoim DNS ani w certyfikatach nie musi się zmieniać.

03

Kredyty są automatyczne

Ta sama umowna dostępność 99.99% obowiązuje tutaj jak wszędzie indziej, a kredyt trafia na konto bez formularza reklamacyjnego.

08

Pytania o tę serię

Fizyczne urządzenie jest przypisane do Twojej instancji przez pełne łącze szesnastu linii. Nie ma partycjonowania vGPU, żadnego time-slicingu ani innego dzierżawcy. Lista urządzeń pokazuje jedną kartę, bo jest jedna karta.

Nie. Karty są miesięczne, a najkrótszy okres zobowiązania to jeden miesiąc. Jeśli Twoje obciążenie jest rzeczywiście impulsowe, tańszy będzie dostawca z rozliczeniem metered, i nie ma wersji tej rozmowy, w której udajemy, że jest inaczej.

Żaden, chyba że poprosisz. Obrazy są czyste, a sterownik instalowany jest wewnątrz instancji, ponieważ połowa naszych klientów GPU ma zdecydowane poglądy na wersje, a druga połowa ma kontener, który niesie własny.

Nie. Siedzą na tym samym hoście i w tej samej domenie NUMA, a komunikują się przez PCIe. W przypadku pracy data-parallel z umiarkowaną wymianą gradientów to wystarczy. W przypadku czegokolwiek, co zakłada szybką sieć między kartami, nie wystarczy, i powinieneś odpowiednio skalować oczekiwania.

Nie. Passthrough wymaga, aby host był do tego zbudowany, z topologią PCIe i budżetem mocy na miejscu. Przejście na tę linię oznacza nową instancję i kopię danych.

Wolumen jest kasowany, a karta wraca do puli. Zdejmij checkpointy przed końcem okresu, ponieważ anulowana instancja naprawdę znika, a nie czeka gdzieś, aż zmienisz zdanie.

Gotowi, gdy jesteś

Weź całą kartę

Najpierw sprawdź arytmetykę pamięci, wybierz lokalizację z odpowiednią pojemnością i zapłać w kryptowalucie. Dostęp root w mniej niż minutę, decyzja o sterowniku należy do Ciebie, a pierwsze siedem dni jest zwrotne bez podania powodu.