Prowadzony od października 2019

Passthrough, nie time-slicing

Każde GPU, które sprzedajemy, to cała fizyczna karta przypisana do jednej instancji. Time-slicing pozwoliłby nam sprzedać każdą kartę czterokrotnie, a my wyceniliśmy to właściwie.

Wystąpienia GPU pojawiły się w tym miesiącu we Frankfurcie, Dallas i Singapurze. Na start dwie konfiguracje: pojedynczy RTX 4000 Ada z dwudziestoma gigabajtami pamięci VRAM oraz pojedynczy L40S z czterdziestoma ośmioma. Oba działają na hoście EPYC 9354P, podłączone przez PCIe 4.0 z pełnymi szesnastoma liniami, przekazane bezpośrednio do jednej instancji.

„Przekazane bezpośrednio” oznacza, że karta jest przypisana do twojej instancji przez hiperwizor przy starcie i pozostaje tam, dopóki nie anulujesz. Bez planisty, bez kolejki, bez innego najemcy, bez podziału pamięci VRAM, z której korzysta również ktoś inny.

Decyzja, którą faktycznie podjęliśmy

Współdzielenie karty między najemcami metodą time-slicing jest wspieranym, dobrze udokumentowanym i w pełni legalnym sposobem prowadzenia tego biznesu. Spędziliśmy około trzech tygodni na kalkulacjach, ponieważ arytmetyka jest atrakcyjna: pojedyncza karta z czterdziestoma ośmioma gigabajtami może być prezentowana jako cztery instancje po dwanaście gigabajtów, co oznacza cztery czynsze z jednego zakupu i czterech klientów z jednego budżetu energetycznego.

Potem zmierzyliśmy opóźnienia końcowe.

Współdzielona karta działa dobrze, gdy inni najemcy są bezczynni, i nieprzyjemnie, gdy nie są. Opóźnienie wnioskowania na karcie z trzema aktywnymi najemcami było mniej więcej takie, jakiego można by się spodziewać w medianie, i od czterech do dziewięciu razy gorsze w 99. percentylu, w zależności od tego, co akurat robili inni. Zadania treningowe radziły sobie gorzej, ponieważ zadanie treningowe nie jest impulsowe i dlatego nigdy nie ma okien.

Jest również problem z licencjami. Oprogramowanie wirtualizacyjne, które umożliwia czysty podział, niesie roczną licencję na kartę i ten koszt nie znika; trafia na fakturę każdego, kto wynajmuje fragment. Musielibyśmy obciążać cię za przywilej współdzielenia.

Jak zbudowany jest host

ElementCo to jest
CPU hostaEPYC 9354P, trzydzieści dwa rdzenie, ECC DDR5-4800
PodłączeniePCIe 4.0, szesnaście linii, jedna grupa IOMMU na kartę
Przypinanie vCPUPrzypięte do gniazda i węzła NUMA, na którym wisi karta
PamięćPrzydzielana z tego samego węzła NUMA, nigdy nie przeplatana
Karty na węzełMaksymalnie cztery, w większości lokalizacji dwie, ograniczone mocą szafy
Port40 Gbit/s, ponieważ model, który nie mieści się w VRAM, musi skądś pochodzić

Przypinanie NUMA ma większe znaczenie, niż sugeruje specyfikacja. vCPU w niewłaściwym gnieździe zasilające kartę przez interconnect traci realną przepustowość na wszystkim, co strumieniuje dane, i jest to najczęstsza błędna konfiguracja, jaką widzimy na hostach GPU gdzie indziej.

Zasilanie i dlaczego są tylko trzy lokalizacje

Karta o mocy trzystu pięćdziesięciu watów zmienia arytmetykę szafy. Lokalizacje, które wygodnie mieszczą dwanaście węzłów ogólnego przeznaczenia, mieszczą cztery węzły GPU i wtedy kończy się chłodzenie. Frankfurt, Dallas i Singapur zostały wybrane, ponieważ wszystkie trzy miały zapas mocy i plan piętra, który mógł przyjąć taką gęstość bez negocjacji.

Kolejne lokalizacje pojawią się, gdy pozwoli na to moc, a uczciwym ograniczeniem jest zawsze energia elektryczna, a nie popyt. Tam, gdzie lokalizacja nie może udźwignąć poboru, wolelibyśmy nie sprzedawać produktu niż sprzedawać go z throttlingiem termicznym.

Czego nie możesz robić

  • Brak łączenia kart między węzłami. Instancja z dwiema kartami istnieje i obie karty leżą na jednym węźle NUMA. Większe konfiguracje to rozmowa o serwerach dedykowanych.
  • Brak partycjonowania w obrębie instancji. Masz całą kartę i to, jak ją podzielisz, zależy od ciebie i twojego frameworka.
  • Brak hot swapu. Zmiana GPU oznacza przebudowę, ponieważ karta jest przypięta przy starcie.
  • Brak konsumenckich kart gamingowych. Pytanie zadawane co tydzień. Nie mają profilu chłodzenia odpowiedniego dla szafy, a w większości przypadków także licencji na wynajem w ogóle.

Cennik, wprost

Karty kosztują tyle, ile kosztują, a marża na nich jest cieńsza niż w pozostałej części katalogu. Nie ma rozliczeń godzinowych, ponieważ rozliczenie godzinowe na dedykowanym sprzęcie oznacza trzymanie kart bezczynnych i obciążanie wszystkich innych za ten przywilej. Miesięcznie, ze standardowym siedmiodniowym zwrotem pieniędzy, i taką samą płatnością tylko w kryptowalutach jak wszystko inne.

Jeśli twoje obciążenie jest naprawdę impulsowe i godzinowe, jesteśmy złym dostawcą, a duży hyperscaler jest właściwym. Tak będzie tak długo, jak długo odmawiamy time-slicingu, czyli bezterminowo.

Gotowi, gdy jesteś

Wybierz miasto. Wybierz rozmiar. Płać kryptowalutą.

Bez formularzy o tym, kim jesteś, bez czekania na akceptację człowieka, bez telefonu w celu weryfikacji. Faktura zostaje uregulowana, a dane logowania trafiają do Twojej skrzynki.