GPU-instanties zijn deze maand live gegaan in Frankfurt, Dallas en Singapore. Twee configuraties om mee te beginnen: een enkele RTX 4000 Ada met twintig gigabyte VRAM, en een enkele L40S met achtenveertig. Beide draaien op een EPYC 9354P-host, aangesloten via PCIe 4.0 op volledige zestien lanes, rechtstreeks doorgegeven aan één instantie.
Doorgegeven betekent dat de kaart bij het opstarten door de hypervisor aan uw instantie is gebonden en daar blijft totdat u annuleert. Geen scheduler, geen wachtrij, geen andere tenant, geen partitionering van VRAM die iemand anders ook gebruikt.
De beslissing die we daadwerkelijk namen
Het tijd-slicen van een kaart tussen tenants is een ondersteunde, goed gedocumenteerde, volkomen legitieme manier om dit bedrijf te runnen. We hebben ongeveer drie weken besteed aan het doorrekenen van de kosten, omdat de rekenkunde aantrekkelijk is: één achtenveertig gigabyte kaart kan worden gepresenteerd als vier twaalf-gigabyte instanties, wat vier huren oplevert van één aankoop en vier klanten van één stroombudget.
Daarna hebben we de staartlatenties gemeten.
Een gedeelde kaart is prima als de andere tenants inactief zijn, en onaangenaam zodra ze dat niet zijn. Inferentielatentie op een kaart met drie andere actieve tenants was ongeveer wat je zou verwachten op de mediaan, en vier tot negen keer slechter op het negenennegentigste percentiel, afhankelijk van wat de anderen toevallig deden. Trainingstaken hadden het nog slechter, omdat een trainingstaak niet bursty is en dus nooit de gaten krijgt.
Er is ook het licentieprobleem. De virtualisatiesoftware die schone partitionering mogelijk maakt, brengt een jaarlijkse licentie per kaart met zich mee, en die kost verdampt niet; hij belandt op de factuur van degene die de slice huurt. We zouden je hebben laten betalen voor het voorrecht om te delen.
Hoe de host is opgebouwd
| Element | Wat het is |
|---|---|
| Host-CPU | EPYC 9354P, tweeëndertig cores, ECC DDR5-4800 |
| Aansluiting | PCIe 4.0, zestien lanes, één IOMMU-groep per kaart |
| vCPU-pinning | Gepind aan de socket en NUMA-node waar de kaart aan hangt |
| Geheugen | Toegewezen van dezelfde NUMA-node, nooit geïnterleaved |
| Kaarten per node | Maximaal vier, op de meeste locaties twee, beperkt door rackvoeding |
| Poort | 40 Gbit/s, want een model dat niet in VRAM past moet ergens vandaan komen |
De NUMA-pinning is belangrijker dan het specificatieblad doet vermoeden. Een vCPU op de verkeerde socket die een kaart via de interconnect voedt, levert echte doorvoer in op alles wat data streamt, en het is de meest voorkomende verkeerde configuratie die we op GPU-hosts elders zien.
Stroom, en waarom er maar drie locaties zijn
Een kaart van driehonderdvijftig watt verandert de rekenkunde van een rack. Locaties die comfortabel twaalf general-purpose nodes bevatten, bevatten vier GPU-nodes en raken dan zonder koeling. Frankfurt, Dallas en Singapore zijn gekozen omdat alle drie stroomreserve hadden en een plattegrond die de dichtheid aankon zonder dat we iets hoefden te heronderhandelen.
Meer locaties volgen zodra de stroom het toelaat, en de eerlijke beperking is altijd elektriciteit, niet vraag. Waar een locatie de belasting niet aankan, verkopen we liever geen product dan dat we het thermisch throttled verkopen.
Wat u niet kunt doen
- Geen kaartkoppeling tussen nodes. Een twee-kaarts instantie bestaat en beide kaarten zitten op één NUMA-node. Alles groter is een gesprek over bare metal.
- Geen partitionering binnen uw instantie. U heeft de hele kaart, en hoe u die verdeelt is tussen u en uw framework.
- Geen hot swap. Het wijzigen van GPU betekent een rebuild, omdat de kaart bij het opstarten is gebonden.
- Geen consumenten-gamingkaarten. Wekelijks naar gevraagd. Ze missen het koelprofiel voor een rack en hebben in de meeste gevallen niet de licentie om überhaupt verhuurd te worden.
Prijzen, duidelijk
De kaarten kosten wat ze kosten en de marge erop is dunner dan op de rest van de catalogus. Er is geen uurtarief, omdat uurtarief op dedicated hardware betekent dat je kaarten idle houdt en iedereen laat betalen voor dat voorrecht. Maandelijks, met de standaard zeven dagen terugbetaling, en dezelfde crypto-only betaling als al het andere.
Als uw workload werkelijk bursty en per uur is, zijn wij de verkeerde leverancier en is een grote hyperscaler de juiste. Dat zal zo blijven zolang we weigeren te tijd-slicen, en dat is voor onbepaalde tijd.