Wystąpienia GPU pojawiły się w tym miesiącu we Frankfurcie, Dallas i Singapurze. Na start dwie konfiguracje: pojedynczy RTX 4000 Ada z dwudziestoma gigabajtami pamięci VRAM oraz pojedynczy L40S z czterdziestoma ośmioma. Oba działają na hoście EPYC 9354P, podłączone przez PCIe 4.0 z pełnymi szesnastoma liniami, przekazane bezpośrednio do jednej instancji.
„Przekazane bezpośrednio” oznacza, że karta jest przypisana do twojej instancji przez hiperwizor przy starcie i pozostaje tam, dopóki nie anulujesz. Bez planisty, bez kolejki, bez innego najemcy, bez podziału pamięci VRAM, z której korzysta również ktoś inny.
Decyzja, którą faktycznie podjęliśmy
Współdzielenie karty między najemcami metodą time-slicing jest wspieranym, dobrze udokumentowanym i w pełni legalnym sposobem prowadzenia tego biznesu. Spędziliśmy około trzech tygodni na kalkulacjach, ponieważ arytmetyka jest atrakcyjna: pojedyncza karta z czterdziestoma ośmioma gigabajtami może być prezentowana jako cztery instancje po dwanaście gigabajtów, co oznacza cztery czynsze z jednego zakupu i czterech klientów z jednego budżetu energetycznego.
Potem zmierzyliśmy opóźnienia końcowe.
Współdzielona karta działa dobrze, gdy inni najemcy są bezczynni, i nieprzyjemnie, gdy nie są. Opóźnienie wnioskowania na karcie z trzema aktywnymi najemcami było mniej więcej takie, jakiego można by się spodziewać w medianie, i od czterech do dziewięciu razy gorsze w 99. percentylu, w zależności od tego, co akurat robili inni. Zadania treningowe radziły sobie gorzej, ponieważ zadanie treningowe nie jest impulsowe i dlatego nigdy nie ma okien.
Jest również problem z licencjami. Oprogramowanie wirtualizacyjne, które umożliwia czysty podział, niesie roczną licencję na kartę i ten koszt nie znika; trafia na fakturę każdego, kto wynajmuje fragment. Musielibyśmy obciążać cię za przywilej współdzielenia.
Jak zbudowany jest host
| Element | Co to jest |
|---|---|
| CPU hosta | EPYC 9354P, trzydzieści dwa rdzenie, ECC DDR5-4800 |
| Podłączenie | PCIe 4.0, szesnaście linii, jedna grupa IOMMU na kartę |
| Przypinanie vCPU | Przypięte do gniazda i węzła NUMA, na którym wisi karta |
| Pamięć | Przydzielana z tego samego węzła NUMA, nigdy nie przeplatana |
| Karty na węzeł | Maksymalnie cztery, w większości lokalizacji dwie, ograniczone mocą szafy |
| Port | 40 Gbit/s, ponieważ model, który nie mieści się w VRAM, musi skądś pochodzić |
Przypinanie NUMA ma większe znaczenie, niż sugeruje specyfikacja. vCPU w niewłaściwym gnieździe zasilające kartę przez interconnect traci realną przepustowość na wszystkim, co strumieniuje dane, i jest to najczęstsza błędna konfiguracja, jaką widzimy na hostach GPU gdzie indziej.
Zasilanie i dlaczego są tylko trzy lokalizacje
Karta o mocy trzystu pięćdziesięciu watów zmienia arytmetykę szafy. Lokalizacje, które wygodnie mieszczą dwanaście węzłów ogólnego przeznaczenia, mieszczą cztery węzły GPU i wtedy kończy się chłodzenie. Frankfurt, Dallas i Singapur zostały wybrane, ponieważ wszystkie trzy miały zapas mocy i plan piętra, który mógł przyjąć taką gęstość bez negocjacji.
Kolejne lokalizacje pojawią się, gdy pozwoli na to moc, a uczciwym ograniczeniem jest zawsze energia elektryczna, a nie popyt. Tam, gdzie lokalizacja nie może udźwignąć poboru, wolelibyśmy nie sprzedawać produktu niż sprzedawać go z throttlingiem termicznym.
Czego nie możesz robić
- Brak łączenia kart między węzłami. Instancja z dwiema kartami istnieje i obie karty leżą na jednym węźle NUMA. Większe konfiguracje to rozmowa o serwerach dedykowanych.
- Brak partycjonowania w obrębie instancji. Masz całą kartę i to, jak ją podzielisz, zależy od ciebie i twojego frameworka.
- Brak hot swapu. Zmiana GPU oznacza przebudowę, ponieważ karta jest przypięta przy starcie.
- Brak konsumenckich kart gamingowych. Pytanie zadawane co tydzień. Nie mają profilu chłodzenia odpowiedniego dla szafy, a w większości przypadków także licencji na wynajem w ogóle.
Cennik, wprost
Karty kosztują tyle, ile kosztują, a marża na nich jest cieńsza niż w pozostałej części katalogu. Nie ma rozliczeń godzinowych, ponieważ rozliczenie godzinowe na dedykowanym sprzęcie oznacza trzymanie kart bezczynnych i obciążanie wszystkich innych za ten przywilej. Miesięcznie, ze standardowym siedmiodniowym zwrotem pieniędzy, i taką samą płatnością tylko w kryptowalutach jak wszystko inne.
Jeśli twoje obciążenie jest naprawdę impulsowe i godzinowe, jesteśmy złym dostawcą, a duży hyperscaler jest właściwym. Tak będzie tak długo, jak długo odmawiamy time-slicingu, czyli bezterminowo.