Een kaart, geen plak van één
Een gedeelde GPU is iemand anders zijn klus die eindigt voordat de jouwe begint. Elke kaart in deze lijn is doorgeschakeld naar één instantie over een volledige zestien-lane link en blijft daar tot je annuleert, idle of niet.
A shared GPU is someone else’s job finishing before yours starts. Every card in this line is passed straight through to a single instance and stays there until you cancel.
| Plan | Toegewezen kernen | Geheugen | NVMe-opslag | Grafisch | Poortsnelheid | Prijs | |
|---|---|---|---|---|---|---|---|
| G-ADA Inference and light training | 8 | 64 GB | 1 TB | 1 × RTX 4000 Ada · 20 GB | 40 Gbit/s | €239.00 /mnd | Configureren |
| G-L40SMeest gekozen 48 GB of VRAM, undivided | 16 | 128 GB | 2 TB | 1 × L40S · 48 GB | 40 Gbit/s | €749.00 /mnd | Configureren |
| G-L40S×2 Two cards, one NUMA node | 32 | 256 GB | 4 TB | 2 × L40S · 96 GB | 40 Gbit/s | €1420.00 /mnd | Configureren |
Prijzen zijn exclusief btw waar van toepassing. Verkeer: Onbeperkt, fair use.
EPYC 9354P host · PCIe 4.0 x16 passthrough · no vGPU time-slicing
Vierendertig steden, negenentwintig landen
Latentiecijfers zijn gemeten medianen van onze eigen probes, geen leveranciersbrochures. Ze bewegen; de pagina werkt bij wanneer ze dat doen.
Passthrough, en waarom het ertoe doet
Het meeste goedkope GPU-capaciteit is een fractie van een kaart die in een wachtrij wordt rondgegeven. Het getal op de productpagina is het geheugen van de kaart, niet het jouwe, en de doorvoer die je meet, hangt af van wie er vanochtend wakker is geworden.
Geen vGPU, geen tijdverdeling, geen scheduler tussen jou en de silicium.
Hier is de kaart op hypervisorniveau aan je instantie gebonden via een zestien-lane PCIe 4.0 link. Het hele apparaat is van jou: al het geheugen, alle rekeneenheden, de volledige copy-engine-bandbreedte. Niets is gepartitioneerd, niets staat in de wachtrij, en geen andere tenant verschijnt in je apparaatlijst.
Het praktische gevolg is dat je benchmark vanavond overeenkomt met je benchmark van vorige dinsdag. Fine-tuning-runs die twee dagen duren, eindigen in de tijd die je eerste uur voorspelde. Interactief werk blijft interactief, omdat er geen batchklus van een andere tenant voor de jouwe staat.
Al het VRAM, de hele tijd
Achtenveertig gigabyte op een L40S, twintig op een RTX 4000 Ada, en niets ervan gereserveerd voor een hypervisorpartitie. Wat de kaart heeft, is wat je proces kan adresseren.
Idle kost je niets extra
De kaart is van jou per maand, niet per seconde. Laat een model drie weken resident tussen experimenten en niemand haalt het terug terwijl je slaapt.
Twee kaarten, één host
De dual-card-laag plaatst beide apparaten in hetzelfde NUMA-domein van dezelfde host. Ze praten over PCIe in plaats van een card-to-card link, wat de moeite waard is om te weten voordat je een trainings-topologie eromheen plant.
Je eigen stack
We hand you a machine with a card in it and stay out of the way. Drivers, container runtime, framework versions and kernel are yours. There is no managed layer that has opinions about your Python.
What these cards suit
Both cards are workstation-class rather than the top of a training cluster, and the honest positioning follows from that.
Inference, fine-tuning, rendering and batch numerical work. In that order.
If your model fits in forty-eight gigabytes, an L40S will serve it competently for as long as you keep paying for it. If it does not fit, no amount of enthusiasm makes it fit, and the next honest step is quantisation, sharding across the dual-card tier, or a different class of machine entirely.
| Workload | Which card | The real constraint |
|---|---|---|
| Serving a quantised model to real users | RTX 4000 Ada | Memory, then request concurrency |
| Serving a mid-size model at full precision | L40S | Forty-eight gigabytes is the ceiling that decides it |
| Fine-tuning with adapters | L40S | VRAM during the backward pass, not raw throughput |
| Full fine-tune of a large model | Two L40S, or somewhere else | Card-to-card bandwidth over PCIe becomes the limit |
| Batch rendering and video encode | Either | Disk and network far more often than the card |
| Numerical simulation in double precision | Neither, usually | These are not double-precision parts. Take EPYC cores |
Wie dit niet zou moeten kopen
GPU capacity attracts optimistic sizing more than any other product we sell. Three groups of people should walk past this line.
The most useful thing we can tell some customers is that we are the wrong shop.
You are training something enormous from scratch
Multi-node training with high-bandwidth interconnect between hosts is not what this is. Two cards over PCIe on one host is our ceiling, and pretending otherwise would waste weeks of your time.
You want per-second billing
Cards are rented by the month. If your usage is genuinely twenty minutes a week, a metered platform will cost you less than we will, and we would rather say so now.
Your model does not fit
Ninety-six gigabytes across two cards is the maximum addressable here. Work out the memory arithmetic for weights, activations and optimiser state before ordering rather than after.
You need double precision
These are single-precision and mixed-precision parts. Scientific codes that insist on FP64 throughput will run faster on forty-eight EPYC cores than on either card.
You want us to manage the stack
We do not maintain your driver, your CUDA version or your framework matrix. The hardening add-on covers the operating system baseline and stops there.
The host around the card
A starved GPU is an expensive space heater. The host matters as much as the card, and it is where most cheap GPU offerings quietly cut the cost.
EPYC 9354P, ECC memory, NVMe local to the machine, forty-gigabit port.
Cores that can feed it
Eight to thirty-two dedicated EPYC cores depending on tier, pinned in the same NUMA domain as the card. Data loading and preprocessing are the usual reason a training loop stalls, and they are CPU work.
ECC memory on the host
Registered DDR5-4800, sixty-four to two hundred and fifty-six gigabytes. A forty-eight-hour job is exactly the kind of thing that should not be undone by one flipped bit in a dataloader buffer.
NVMe that keeps up
Eén tot vier terabyte lokale Gen4-NVMe, gespiegeld. Datasets streamen vanaf de machine zelf in plaats van via een netwerkvolume waar iemand anders ook op leest.
Een 40-gigabit-poort
Het binnenhalen van een dataset van meerdere terabytes zou een avond moeten duren. Fair use op een 40-gigabit-poort is 250 terabyte per maand, gepubliceerd op de prijspagina.
Out-of-band console
Serieel en VNC via een geverifieerde tunnel, inbegrepen. Als een driverinstallatie midden in de nacht misgaat, kun je de machine nog steeds bereiken. Dat is de hele reden dat dit bestaat.
De kaart wordt doorgeschoven, dus de driver wordt in je instance geïnstalleerd zoals op elke andere machine. Niets op de host raakt jouw framework aan, en een herstart heronderhandelt niets.
Waar de kaarten staan
Amsterdam, Frankfurt, Londen, New York, Dallas, Los Angeles, Singapore en Tokio. Dat zijn de vloeren met de vermogensdichtheid en koeling om kaarten continu op volle belasting te draaien, in plaats van in beleefde uitbarstingen.
Acht locaties in zes landen. GPU's hebben stroom en koeling nodig, geen postcodes.
Frankfurt is de drukste GPU-vloer die we exploiteren en krijgt als eerste nieuwe kaarten. Dallas is de makkelijkste plek om op korte termijn capaciteit te krijgen, omdat stroom daar goedkoop is en de vloer groot is. Los Angeles heeft kaarten, maar is vaak bijna uitverkocht. Bestel dus vroeg als je de westelijke route naar Azië wilt kopen.
Voorraad beweegt echt op deze lijn. Een kaart die 's middags als beschikbaar wordt getoond, kan 's avonds weg zijn. We tonen liever een nauwkeurig label “uitverkocht” dan een bestelling aan te nemen die we deze week niet kunnen leveren.
| Locatie | Opmerkingen | Typisch gebruik |
|---|---|---|
| Amsterdam | Dichtste locatie in het netwerk, alles wordt hier eerst verzonden | Europese inferentie met lage latentie naar het grootste deel van het continent |
| Frankfurt | Drukste GPU-vloer, ontvangt als eerste nieuwe kaarten | Training en fine-tuning waar capaciteit belangrijker is dan de laatste milliseconde |
| Londen | Laagste transatlantische latentie in Europa | Bedient gebruikers aan beide kanten van de Atlantische Oceaan vanaf één plek |
| New York | Anker aan de oostkust, volledig productassortiment | Noord-Amerikaanse inferentie |
| Dallas | Goedkope stroom, grote vloer, makkelijkste capaciteit | Lange batchjobs en alles wat prijsgevoelig is |
| Los Angeles | Beste westelijke routes die we buiten Azië hebben | Bedient de Pacifische regio vanuit Noord-Amerika |
| Singapore | Standaardkeuze voor Zuidoost-Azië | Regionale inferentie |
| Tokio | Meest stabiele round-trip-tijd in de regio | Latentiegevoelig Japans en Koreaans verkeer |
Lange taken, en hoe je er geen verliest
Een fine-tune van achtenveertig uur is een weddenschap dat er twee dagen lang niets misgaat. Structureer de taak zo dat het verliezen van de weddenschap je een uur kost in plaats van het weekend.
Checkpoint. We zeggen het nog steeds nadat je het honderd keer hebt gehoord.
- 01
Checkpoint vaak naar lokale NVMe
Elke paar honderd stappen, naar de lokale schijf, omdat die snel genoeg is dat de kosten verwaarloosbaar zijn. Een taak die niet kan hervatten, is een taak die je uiteindelijk twee keer zult draaien.
- 02
Kopieer checkpoints van de machine
Lokale NVMe is gespiegeld, niet onsterfelijk. Off-node-back-ups schrijven elke nacht naar een andere stad, en dat is de goedkoopste verzekering op deze pagina.
- 03
Maak een snapshot voordat je de driver aanraakt
Driver- en frameworkupgrades zijn de belangrijkste oorzaak dat een werkende omgeving een niet-werkende wordt. Een snapshot maken duurt seconden, en terugzetten ook.
- 04
Houd temperatuur en klokfrequenties in de gaten, niet alleen het verlies
Kaarten schakelen terug wanneer de ruimte een slechte dag heeft. Als je doorvoer daalt zonder dat je code verandert, kijk dan eerst naar de klokwaarden voordat je de dataloader herschrijft.
- 05
Vraag voordat je horizontaal schaalt
Als de volgende stap vier of acht kaarten is, vertel de support dan wat je probeert te bereiken. Soms is het antwoord een bare-metal machine, en soms is het antwoord dat wij niet de juiste leverancier zijn.
Wanneer de hardware faalt
GPU's gaan meestal geleidelijk achteruit in plaats van dood te gaan: dalende klokfrequenties, gecorrigeerde geheugenfouten op de kaart, een taak die plotseling een derde langzamer draait zonder reden die je in je code kunt vinden.
Kaarten falen anders dan schijven. Langzamer, en met meer waarschuwing.
Onze monitoring volgt kaarttemperatuur, klokgedrag en fouttellers op elke host. Wanneer een kaart zich misdraagt, nemen we contact met je op voordat hij stopt met werken, en plannen we de vervanging rondom je taak in plaats van er dwars doorheen. Als de kaart volledig uitvalt, wordt je instantie herbouwd op een andere host in dezelfde site, met behoud van volumes en adressen.
Herstel op deze lijn is langzamer dan elders in het wagenpark, en het is de moeite waard om daar duidelijk over te zijn: een terabyte aan dataset en een resident model hebben echt enkele minuten nodig om te verplaatsen en opnieuw te laden. Plan voor een uur in plaats van vijftien minuten, en bewaar checkpoints ergens anders dan op de machine die in brand staat.
Waarschuwing voor falen, waar mogelijk
Fouttellers en kloktelemetrie worden continu uitgelezen. De meeste kaartvervangingen vinden plaats in een venster dat we vooraf met de klant hebben afgesproken.
Volumes en adressen blijven behouden
De herbouw draagt je NVMe-inhoud en IP-adressen over. Er hoeft niets te veranderen aan je DNS of je certificaten.
Credits zijn automatisch
Dezelfde contractuele 99,99% uptime geldt hier als overal elders, en de credit wordt toegekend zonder claimformulier.
Vragen over deze lijn
Het fysieke apparaat is gebonden aan je instantie via een volledige zestien-lane-verbinding. Er is geen vGPU-partitionering, geen time-slicing en geen andere tenant op de kaart. Je apparaatlijst toont één kaart omdat er één kaart is.
Nee. Kaarten worden per maand verhuurd en de kortste verbintenis is één maand. Als je workload echt piekerig is, is een provider met betalen per gebruik goedkoper, en er is geen versie van dit gesprek waarin we iets anders beweren.
Geen, tenzij je erom vraagt. Images worden schoon geleverd en de driver wordt binnen je instantie geïnstalleerd, omdat de helft van onze GPU-klanten sterke meningen heeft over versies en de andere helft een container heeft die zijn eigen driver meebrengt.
Nee. Ze bevinden zich op dezelfde host en in hetzelfde NUMA-domein, en ze communiceren via PCIe. Voor data-parallel werk met bescheiden gradiëntuitwisseling is dit prima. Voor alles dat uitgaat van een high-bandwidth fabric tussen kaarten, is dat niet het geval, en je moet je verwachtingen daarop afstemmen.
Nee. Passthrough vereist dat de host daarvoor is gebouwd, met de PCIe-topologie en het vermogensbudget op hun plaats. Verhuizen naar deze lijn betekent een nieuwe instantie en een datakopie.
Het volume wordt gewist en de kaart gaat terug naar de pool. Haal je checkpoints eraf voordat de termijn afloopt, want een geannuleerde instantie is echt weg in plaats van ergens geparkeerd te staan totdat je van gedachten verandert.
Neem een hele kaart
Controleer eerst de geheugenberekening, kies de site met capaciteit en betaal in munten. Root-toegang arriveert binnen een minuut, de driverbeslissing blijft jouw keuze, en de eerste zeven dagen zijn zonder opgaaf van reden restitueerbaar.