Lijn drie van vijf

Een kaart, geen plak van één

Een gedeelde GPU is iemand anders zijn klus die eindigt voordat de jouwe begint. Elke kaart in deze lijn is doorgeschakeld naar één instantie over een volledige zestien-lane link en blijft daar tot je annuleert, idle of niet.

Vloot
vanaf€239
ImplementatieBinnen een minuut
Beschikbaar op8
VerkeerOnbeperkt, fair use

A shared GPU is someone else’s job finishing before yours starts. Every card in this line is passed straight through to a single instance and stays there until you cancel.

Prijs
PlanToegewezen kernenGeheugenNVMe-opslagGrafischPoortsnelheidPrijs
G-ADA
Inference and light training
864 GB1 TB1 × RTX 4000 Ada · 20 GB40 Gbit/s€239.00
/mnd
Configureren
G-L40SMeest gekozen
48 GB of VRAM, undivided
16128 GB2 TB1 × L40S · 48 GB40 Gbit/s€749.00
/mnd
Configureren
G-L40S×2
Two cards, one NUMA node
32256 GB4 TB2 × L40S · 96 GB40 Gbit/s€1420.00
/mnd
Configureren

Prijzen zijn exclusief btw waar van toepassing. Verkeer: Onbeperkt, fair use.

EPYC 9354P host · PCIe 4.0 x16 passthrough · no vGPU time-slicing

00

Vierendertig steden, negenentwintig landen

Latentiecijfers zijn gemeten medianen van onze eigen probes, geen leveranciersbrochures. Ze bewegen; de pagina werkt bij wanneer ze dat doen.

01

Passthrough, en waarom het ertoe doet

Het meeste goedkope GPU-capaciteit is een fractie van een kaart die in een wachtrij wordt rondgegeven. Het getal op de productpagina is het geheugen van de kaart, niet het jouwe, en de doorvoer die je meet, hangt af van wie er vanochtend wakker is geworden.

Geen vGPU, geen tijdverdeling, geen scheduler tussen jou en de silicium.

Hier is de kaart op hypervisorniveau aan je instantie gebonden via een zestien-lane PCIe 4.0 link. Het hele apparaat is van jou: al het geheugen, alle rekeneenheden, de volledige copy-engine-bandbreedte. Niets is gepartitioneerd, niets staat in de wachtrij, en geen andere tenant verschijnt in je apparaatlijst.

Het praktische gevolg is dat je benchmark vanavond overeenkomt met je benchmark van vorige dinsdag. Fine-tuning-runs die twee dagen duren, eindigen in de tijd die je eerste uur voorspelde. Interactief werk blijft interactief, omdat er geen batchklus van een andere tenant voor de jouwe staat.

01

Al het VRAM, de hele tijd

Achtenveertig gigabyte op een L40S, twintig op een RTX 4000 Ada, en niets ervan gereserveerd voor een hypervisorpartitie. Wat de kaart heeft, is wat je proces kan adresseren.

02

Idle kost je niets extra

De kaart is van jou per maand, niet per seconde. Laat een model drie weken resident tussen experimenten en niemand haalt het terug terwijl je slaapt.

03

Twee kaarten, één host

De dual-card-laag plaatst beide apparaten in hetzelfde NUMA-domein van dezelfde host. Ze praten over PCIe in plaats van een card-to-card link, wat de moeite waard is om te weten voordat je een trainings-topologie eromheen plant.

04

Je eigen stack

We hand you a machine with a card in it and stay out of the way. Drivers, container runtime, framework versions and kernel are yours. There is no managed layer that has opinions about your Python.

02

What these cards suit

Both cards are workstation-class rather than the top of a training cluster, and the honest positioning follows from that.

Inference, fine-tuning, rendering and batch numerical work. In that order.

If your model fits in forty-eight gigabytes, an L40S will serve it competently for as long as you keep paying for it. If it does not fit, no amount of enthusiasm makes it fit, and the next honest step is quantisation, sharding across the dual-card tier, or a different class of machine entirely.

WorkloadWhich cardThe real constraint
Serving a quantised model to real usersRTX 4000 AdaMemory, then request concurrency
Serving a mid-size model at full precisionL40SForty-eight gigabytes is the ceiling that decides it
Fine-tuning with adaptersL40SVRAM during the backward pass, not raw throughput
Full fine-tune of a large modelTwo L40S, or somewhere elseCard-to-card bandwidth over PCIe becomes the limit
Batch rendering and video encodeEitherDisk and network far more often than the card
Numerical simulation in double precisionNeither, usuallyThese are not double-precision parts. Take EPYC cores
03

Wie dit niet zou moeten kopen

GPU capacity attracts optimistic sizing more than any other product we sell. Three groups of people should walk past this line.

The most useful thing we can tell some customers is that we are the wrong shop.

01

You are training something enormous from scratch

Multi-node training with high-bandwidth interconnect between hosts is not what this is. Two cards over PCIe on one host is our ceiling, and pretending otherwise would waste weeks of your time.

02

You want per-second billing

Cards are rented by the month. If your usage is genuinely twenty minutes a week, a metered platform will cost you less than we will, and we would rather say so now.

03

Your model does not fit

Ninety-six gigabytes across two cards is the maximum addressable here. Work out the memory arithmetic for weights, activations and optimiser state before ordering rather than after.

04

You need double precision

These are single-precision and mixed-precision parts. Scientific codes that insist on FP64 throughput will run faster on forty-eight EPYC cores than on either card.

05

You want us to manage the stack

We do not maintain your driver, your CUDA version or your framework matrix. The hardening add-on covers the operating system baseline and stops there.

04

The host around the card

A starved GPU is an expensive space heater. The host matters as much as the card, and it is where most cheap GPU offerings quietly cut the cost.

EPYC 9354P, ECC memory, NVMe local to the machine, forty-gigabit port.

01

Cores that can feed it

Eight to thirty-two dedicated EPYC cores depending on tier, pinned in the same NUMA domain as the card. Data loading and preprocessing are the usual reason a training loop stalls, and they are CPU work.

02

ECC memory on the host

Registered DDR5-4800, sixty-four to two hundred and fifty-six gigabytes. A forty-eight-hour job is exactly the kind of thing that should not be undone by one flipped bit in a dataloader buffer.

03

NVMe that keeps up

Eén tot vier terabyte lokale Gen4-NVMe, gespiegeld. Datasets streamen vanaf de machine zelf in plaats van via een netwerkvolume waar iemand anders ook op leest.

04

Een 40-gigabit-poort

Het binnenhalen van een dataset van meerdere terabytes zou een avond moeten duren. Fair use op een 40-gigabit-poort is 250 terabyte per maand, gepubliceerd op de prijspagina.

05

Out-of-band console

Serieel en VNC via een geverifieerde tunnel, inbegrepen. Als een driverinstallatie midden in de nacht misgaat, kun je de machine nog steeds bereiken. Dat is de hele reden dat dit bestaat.

De kaart wordt doorgeschoven, dus de driver wordt in je instance geïnstalleerd zoals op elke andere machine. Niets op de host raakt jouw framework aan, en een herstart heronderhandelt niets.

05

Waar de kaarten staan

Amsterdam, Frankfurt, Londen, New York, Dallas, Los Angeles, Singapore en Tokio. Dat zijn de vloeren met de vermogensdichtheid en koeling om kaarten continu op volle belasting te draaien, in plaats van in beleefde uitbarstingen.

Acht locaties in zes landen. GPU's hebben stroom en koeling nodig, geen postcodes.

Frankfurt is de drukste GPU-vloer die we exploiteren en krijgt als eerste nieuwe kaarten. Dallas is de makkelijkste plek om op korte termijn capaciteit te krijgen, omdat stroom daar goedkoop is en de vloer groot is. Los Angeles heeft kaarten, maar is vaak bijna uitverkocht. Bestel dus vroeg als je de westelijke route naar Azië wilt kopen.

Voorraad beweegt echt op deze lijn. Een kaart die 's middags als beschikbaar wordt getoond, kan 's avonds weg zijn. We tonen liever een nauwkeurig label “uitverkocht” dan een bestelling aan te nemen die we deze week niet kunnen leveren.

LocatieOpmerkingenTypisch gebruik
AmsterdamDichtste locatie in het netwerk, alles wordt hier eerst verzondenEuropese inferentie met lage latentie naar het grootste deel van het continent
FrankfurtDrukste GPU-vloer, ontvangt als eerste nieuwe kaartenTraining en fine-tuning waar capaciteit belangrijker is dan de laatste milliseconde
LondenLaagste transatlantische latentie in EuropaBedient gebruikers aan beide kanten van de Atlantische Oceaan vanaf één plek
New YorkAnker aan de oostkust, volledig productassortimentNoord-Amerikaanse inferentie
DallasGoedkope stroom, grote vloer, makkelijkste capaciteitLange batchjobs en alles wat prijsgevoelig is
Los AngelesBeste westelijke routes die we buiten Azië hebbenBedient de Pacifische regio vanuit Noord-Amerika
SingaporeStandaardkeuze voor Zuidoost-AziëRegionale inferentie
TokioMeest stabiele round-trip-tijd in de regioLatentiegevoelig Japans en Koreaans verkeer
06

Lange taken, en hoe je er geen verliest

Een fine-tune van achtenveertig uur is een weddenschap dat er twee dagen lang niets misgaat. Structureer de taak zo dat het verliezen van de weddenschap je een uur kost in plaats van het weekend.

Checkpoint. We zeggen het nog steeds nadat je het honderd keer hebt gehoord.

  1. 01

    Checkpoint vaak naar lokale NVMe

    Elke paar honderd stappen, naar de lokale schijf, omdat die snel genoeg is dat de kosten verwaarloosbaar zijn. Een taak die niet kan hervatten, is een taak die je uiteindelijk twee keer zult draaien.

  2. 02

    Kopieer checkpoints van de machine

    Lokale NVMe is gespiegeld, niet onsterfelijk. Off-node-back-ups schrijven elke nacht naar een andere stad, en dat is de goedkoopste verzekering op deze pagina.

  3. 03

    Maak een snapshot voordat je de driver aanraakt

    Driver- en frameworkupgrades zijn de belangrijkste oorzaak dat een werkende omgeving een niet-werkende wordt. Een snapshot maken duurt seconden, en terugzetten ook.

  4. 04

    Houd temperatuur en klokfrequenties in de gaten, niet alleen het verlies

    Kaarten schakelen terug wanneer de ruimte een slechte dag heeft. Als je doorvoer daalt zonder dat je code verandert, kijk dan eerst naar de klokwaarden voordat je de dataloader herschrijft.

  5. 05

    Vraag voordat je horizontaal schaalt

    Als de volgende stap vier of acht kaarten is, vertel de support dan wat je probeert te bereiken. Soms is het antwoord een bare-metal machine, en soms is het antwoord dat wij niet de juiste leverancier zijn.

07

Wanneer de hardware faalt

GPU's gaan meestal geleidelijk achteruit in plaats van dood te gaan: dalende klokfrequenties, gecorrigeerde geheugenfouten op de kaart, een taak die plotseling een derde langzamer draait zonder reden die je in je code kunt vinden.

Kaarten falen anders dan schijven. Langzamer, en met meer waarschuwing.

Onze monitoring volgt kaarttemperatuur, klokgedrag en fouttellers op elke host. Wanneer een kaart zich misdraagt, nemen we contact met je op voordat hij stopt met werken, en plannen we de vervanging rondom je taak in plaats van er dwars doorheen. Als de kaart volledig uitvalt, wordt je instantie herbouwd op een andere host in dezelfde site, met behoud van volumes en adressen.

Herstel op deze lijn is langzamer dan elders in het wagenpark, en het is de moeite waard om daar duidelijk over te zijn: een terabyte aan dataset en een resident model hebben echt enkele minuten nodig om te verplaatsen en opnieuw te laden. Plan voor een uur in plaats van vijftien minuten, en bewaar checkpoints ergens anders dan op de machine die in brand staat.

01

Waarschuwing voor falen, waar mogelijk

Fouttellers en kloktelemetrie worden continu uitgelezen. De meeste kaartvervangingen vinden plaats in een venster dat we vooraf met de klant hebben afgesproken.

02

Volumes en adressen blijven behouden

De herbouw draagt je NVMe-inhoud en IP-adressen over. Er hoeft niets te veranderen aan je DNS of je certificaten.

03

Credits zijn automatisch

Dezelfde contractuele 99,99% uptime geldt hier als overal elders, en de credit wordt toegekend zonder claimformulier.

08

Vragen over deze lijn

Het fysieke apparaat is gebonden aan je instantie via een volledige zestien-lane-verbinding. Er is geen vGPU-partitionering, geen time-slicing en geen andere tenant op de kaart. Je apparaatlijst toont één kaart omdat er één kaart is.

Nee. Kaarten worden per maand verhuurd en de kortste verbintenis is één maand. Als je workload echt piekerig is, is een provider met betalen per gebruik goedkoper, en er is geen versie van dit gesprek waarin we iets anders beweren.

Geen, tenzij je erom vraagt. Images worden schoon geleverd en de driver wordt binnen je instantie geïnstalleerd, omdat de helft van onze GPU-klanten sterke meningen heeft over versies en de andere helft een container heeft die zijn eigen driver meebrengt.

Nee. Ze bevinden zich op dezelfde host en in hetzelfde NUMA-domein, en ze communiceren via PCIe. Voor data-parallel werk met bescheiden gradiëntuitwisseling is dit prima. Voor alles dat uitgaat van een high-bandwidth fabric tussen kaarten, is dat niet het geval, en je moet je verwachtingen daarop afstemmen.

Nee. Passthrough vereist dat de host daarvoor is gebouwd, met de PCIe-topologie en het vermogensbudget op hun plaats. Verhuizen naar deze lijn betekent een nieuwe instantie en een datakopie.

Het volume wordt gewist en de kaart gaat terug naar de pool. Haal je checkpoints eraf voordat de termijn afloopt, want een geannuleerde instantie is echt weg in plaats van ergens geparkeerd te staan totdat je van gedachten verandert.

Klaar wanneer jij dat bent

Neem een hele kaart

Controleer eerst de geheugenberekening, kies de site met capaciteit en betaal in munten. Root-toegang arriveert binnen een minuut, de driverbeslissing blijft jouw keuze, en de eerste zeven dagen zijn zonder opgaaf van reden restitueerbaar.