Eine Karte, kein Teil davon
Eine geteilte GPU bedeutet, dass die Arbeit eines anderen zuerst fertig wird. Jede Karte in dieser Linie wird über eine volle 16-Lane-Verbindung an eine Instanz durchgereicht und bleibt dort, bis Sie kündigen, ob idle oder nicht.
A shared GPU is someone else’s job finishing before yours starts. Every card in this line is passed straight through to a single instance and stays there until you cancel.
| Tarif | Dedizierte Kerne | Arbeitsspeicher | NVMe-Speicher | Grafik | Portgeschwindigkeit | Preis | |
|---|---|---|---|---|---|---|---|
| G-ADA Inference and light training | 8 | 64 GB | 1 TB | 1 × RTX 4000 Ada · 20 GB | 40 Gbit/s | €239.00 /Monat | Konfigurieren |
| G-L40SAm meisten genommen 48 GB of VRAM, undivided | 16 | 128 GB | 2 TB | 1 × L40S · 48 GB | 40 Gbit/s | €749.00 /Monat | Konfigurieren |
| G-L40S×2 Two cards, one NUMA node | 32 | 256 GB | 4 TB | 2 × L40S · 96 GB | 40 Gbit/s | €1420.00 /Monat | Konfigurieren |
Preise zuzüglich MwSt., sofern anwendbar. Traffic: Unbegrenzt, faire Nutzung.
EPYC 9354P host · PCIe 4.0 x16 passthrough · no vGPU time-slicing
Vierunddreißig Städte, neunundzwanzig Länder
Latenzwerte sind gemessene Mediane von unseren eigenen Sonden, nicht Verkaufsbroschüren. Sie bewegen sich; die Seite aktualisiert sich, wenn sie es tun.
Passthrough und warum es wichtig ist
Die meisten billigen GPU-Kapazitäten sind ein Bruchteil einer Karte, der durch eine Warteschlange gereicht wird. Die Zahl auf der Produktseite ist der Speicher der Karte, nicht Ihrer, und der Durchsatz, den Sie messen, hängt davon ab, wer sonst heute Morgen aufgewacht ist.
Kein vGPU, kein Time-Slicing, kein Scheduler zwischen Ihnen und dem Silizium.
Hier ist die Karte auf Hypervisor-Ebene über eine 16-Lane-PCIe-4.0-Verbindung an Ihre Instanz gebunden. Das gesamte Gerät gehört Ihnen: der gesamte Speicher, alle Recheneinheiten, die volle Copy-Engine-Bandbreite. Nichts ist partitioniert, nichts ist in der Warteschlange, und kein anderer Mandant erscheint in Ihrer Geräteliste.
Die praktische Konsequenz ist, dass Ihr Benchmark heute Abend Ihrem Benchmark von letztem Dienstag entspricht. Feintuning-Läufe, die zwei Tage dauern, sind in der Zeit fertig, die Ihre erste Stunde vorhergesagt hat. Interaktive Arbeit bleibt interaktiv, weil kein Batch-Job eines anderen Mandanten vor Ihrem liegt.
Der gesamte VRAM, die ganze Zeit
Achtundvierzig Gigabyte auf einer L40S, zwanzig auf einer RTX 4000 Ada, und nichts davon ist für eine Hypervisor-Partition reserviert. Was die Karte hat, ist das, was Ihr Prozess adressieren kann.
Leerlauf kostet Sie nichts extra
Die Karte gehört Ihnen pro Monat, nicht pro Sekunde. Lassen Sie ein Modell drei Wochen zwischen Experimenten resident und niemand holt es sich zurück, während Sie schlafen.
Zwei Karten, ein Host
Die Zwei-Karten-Stufe platziert beide Geräte in derselben NUMA-Domäne desselben Hosts. Sie kommunizieren über PCIe statt über eine Karte-zu-Karte-Verbindung, was man wissen sollte, bevor man eine Trainings-Topologie um sie plant.
Ihr eigener Stack
Wir übergeben Ihnen eine Maschine mit einer Karte darin und bleiben Ihnen aus dem Weg. Treiber, Container-Runtime, Framework-Versionen und Kernel gehören Ihnen. Es gibt keine verwaltete Ebene, die Meinungen über Ihr Python hat.
Wofür diese Karten geeignet sind
Beide Karten sind Workstation-Klasse und nicht die Spitze eines Trainingsclusters, und die ehrliche Positionierung folgt daraus.
Inferenz, Feintuning, Rendering und numerische Stapelverarbeitung. In dieser Reihenfolge.
Wenn Ihr Modell in achtundvierzig Gigabyte passt, wird eine L40S es kompetent bedienen, solange Sie dafür zahlen. Wenn es nicht passt, macht keine Begeisterung es passend, und der nächste ehrliche Schritt ist Quantisierung, Aufteilung auf die Zwei-Karten-Stufe oder eine völlig andere Maschinenklasse.
| Workload | Welche Karte | Die eigentliche Grenze |
|---|---|---|
| Quantisiertes Modell für echte Benutzer ausliefern | RTX 4000 Ada | Speicher, dann Anfrageparallelität |
| Modell mittlerer Größe in voller Präzision ausliefern | L40S | Achtundvierzig Gigabyte sind die Obergrenze, die es entscheidet |
| Feintuning mit Adaptern | L40S | VRAM während des Rückwärtsdurchgangs, nicht roher Durchsatz |
| Vollständiges Feintuning eines großen Modells | Zwei L40S oder woanders | Karte-zu-Karte-Bandbreite über PCIe wird zur Grenze |
| Stapelrendering und Video-Encoding | Egal welche | Festplatte und Netzwerk viel öfter als die Karte |
| Numerische Simulation in doppelter Genauigkeit | Normalerweise keine | Das sind keine Doppelpräzisionsteile. Nehmen Sie EPYC-Kerne |
Wer dies nicht kaufen sollte
GPU-Kapazität zieht optimistische Größenplanung mehr an als jedes andere Produkt, das wir verkaufen. Drei Gruppen von Leuten sollten an dieser Reihe vorbeigehen.
Das Nützlichste, was wir manchen Kunden sagen können, ist, dass wir der falsche Laden sind.
Sie trainieren etwas Enormes von Grund auf
Multi-Node-Training mit Hochgeschwindigkeitsverbindung zwischen Hosts ist nicht das, was das ist. Zwei Karten über PCIe auf einem Host ist unsere Obergrenze, und etwas anderes zu behaupten würde Wochen Ihrer Zeit verschwenden.
Sie möchten Abrechnung pro Sekunde
Karten werden monatlich gemietet. Wenn Ihre Nutzung wirklich zwanzig Minuten pro Woche beträgt, wird eine abgerechnete Plattform weniger kosten als wir, und wir sagen das lieber jetzt.
Ihr Modell passt nicht
Sechsundneunzig Gigabyte über zwei Karten sind das hier maximal adressierbare. Rechnen Sie die Speicherarithmetik für Gewichte, Aktivierungen und Optimiererzustand vor der Bestellung durch, nicht danach.
Sie benötigen doppelte Genauigkeit
Das sind Einzelpräzisions- und gemischtpräzisionsteile. Wissenschaftliche Codes, die auf FP64-Durchsatz bestehen, laufen schneller auf achtundvierzig EPYC-Kernen als auf jeder der beiden Karten.
Sie möchten, dass wir den Stack verwalten
Wir pflegen weder Ihren Treiber, noch Ihre CUDA-Version oder Ihre Framework-Matrix. Das Härtungs-Add-on deckt die Betriebssystem-Basislinie ab und hört dort auf.
Der Host um die Karte
Eine ausgehungerte GPU ist ein teurer Heizlüfter. Der Host ist so wichtig wie die Karte, und genau dort sparen die meisten billigen GPU-Angebote leise Kosten.
EPYC 9354P, ECC-Speicher, NVMe lokal zur Maschine, 40-Gigabit-Port.
Kerne, die sie füttern können
Acht bis zweiunddreißig dedizierte EPYC-Kerne je nach Stufe, in derselben NUMA-Domäne wie die Karte gepinnt. Datenladen und Vorverarbeitung sind der übliche Grund, warum eine Trainingsschleife ins Stocken gerät, und das ist CPU-Arbeit.
ECC-Speicher auf dem Host
Registrierter DDR5-4800, vierundsechzig bis zweihundertsechsundfünfzig Gigabyte. Ein 48-Stunden-Job ist genau die Art von Sache, die nicht durch ein einzelnes gekipptes Bit in einem Datenlader-Puffer ruiniert werden sollte.
NVMe, das mithält
Ein bis vier Terabyte lokaler Gen4-NVMe, gespiegelt. Datensätze werden von der Maschine selbst gestreamt und nicht über ein Netzwerk-Volume, das auch jemand anderes liest.
Ein 40-Gigabit-Port
Das Herunterladen eines Multi-Terabyte-Datensatzes sollte einen Abend dauern. Fair Use auf einem 40-Gigabit-Port liegt bei 250 Terabyte pro Monat, veröffentlicht auf der Preisseite.
Out-of-Band-Konsole
Seriell und VNC über einen authentifizierten Tunnel, inklusive. Wenn um Mitternacht eine Treiberinstallation schiefgeht, kannst du die Maschine trotzdem erreichen – das ist der eigentliche Grund, warum es sie gibt.
Die Karte wird durchgereicht, der Treiber wird also wie bei jeder anderen Maschine in deiner Instanz installiert. Nichts auf dem Host berührt dein Framework, und ein Neustart verhandelt nichts neu.
Wo die Karten stehen
Amsterdam, Frankfurt, London, New York, Dallas, Los Angeles, Singapur und Tokio. Das sind die Standorte mit der Energiedichte und Kühlung, um Karten dauerhaft unter Volllast zu betreiben, statt in höflichen Stößen.
Acht Standorte in sechs Ländern. GPUs brauchen Strom und Kühlung, keine Postleitzahlen.
Frankfurt ist der GPU-Standort mit dem höchsten Durchsatz und bekommt neue Karten zuerst. Dallas ist der einfachste Ort, um kurzfristig Kapazität zu bekommen, weil Strom dort günstig ist und die Fläche groß. Los Angeles hat Karten, ist aber oft ausgelastet – also früh bestellen, wenn du die Westroute nach Asien kaufen willst.
Bei dieser Linie bewegt sich der Bestand wirklich. Eine Karte, die mittags als verfügbar angezeigt wird, kann abends weg sein. Wir zeigen dir lieber ein korrektes Ausverkauft-Label, als eine Bestellung anzunehmen, die wir diese Woche nicht füllen können.
| Standort | Anmerkungen | Typische Nutzung |
|---|---|---|
| Amsterdam | Dichtester Standort der Flotte, alles wird hier zuerst ausgeliefert | Europäische Inferenz mit niedriger Latenz zum größten Teil des Kontinents |
| Frankfurt | GPU-Standort mit dem höchsten Durchsatz, bekommt neue Karten zuerst | Training und Feintuning, wenn Kapazität wichtiger ist als die letzte Millisekunde |
| London | Niedrigste transatlantische Latenz in Europa | Bedienung von Nutzern auf beiden Seiten des Atlantiks von einem Ort aus |
| New York | Anker der Ostküste, volles Produktsortiment | Nordamerikanische Inferenz |
| Dallas | Günstiger Strom, große Fläche, einfachste Kapazität | Lange Batch-Jobs und alles Preisbewusste |
| Los Angeles | Beste Westrouten, die wir außerhalb Asiens haben | Bedienung des Pazifikraums aus Nordamerika |
| Singapur | Standardwahl für Südostasien | Regionale Inferenz |
| Tokio | Stabilste Round-Trip-Zeit in der Region | Latenzempfindlicher japanischer und koreanischer Traffic |
Lange Jobs und wie man keinen verliert
Ein 48-Stunden-Feintuning ist eine Wette darauf, dass zwei Tage lang nichts schiefgeht. Strukturiere den Job so, dass ein Verlust der Wette dich eine Stunde kostet statt das Wochenende.
Checkpoint. Wir werden es auch dann sagen, wenn du es hundertmal gehört hast.
- 01
Checkpoint auf lokales NVMe, oft
Alle paar hundert Schritte auf die lokale Platte, denn das ist schnell genug, dass die Kosten vernachlässigbar sind. Ein Job, der nicht fortgesetzt werden kann, ist ein Job, den du letztendlich zweimal ausführst.
- 02
Checkpoints von der Box kopieren
Lokales NVMe ist gespiegelt, nicht unsterblich. Off-Node-Backups schreiben nachts in eine andere Stadt, und das ist die günstigste Versicherung auf dieser Seite.
- 03
Snapshot, bevor du den Treiber anfasst
Treiber- und Framework-Upgrades sind die Hauptursache dafür, dass aus einer funktionierenden Umgebung eine nicht funktionierende wird. Ein Snapshot dauert Sekunden zu erstellen und Sekunden zum Wiederherstellen.
- 04
Temperatur und Taktraten beobachten, nicht nur den Verlust
Karten drosseln, wenn der Raum einen schlechten Tag hat. Wenn Ihr Durchsatz sinkt, ohne dass sich Ihr Code ändert, prüfen Sie die Taktraten, bevor Sie den Dataloader umschreiben.
- 05
Fragen Sie, bevor Sie horizontal skalieren
Wenn der nächste Schritt vier oder acht Karten sind, teilen Sie dem Support mit, was Sie erreichen möchten. Manchmal ist die Antwort eine Bare-Metal-Maschine, und gelegentlich ist die Antwort, dass wir nicht der richtige Anbieter sind.
Wenn die Hardware ausfällt
GPUs degradieren meist eher, als dass sie sterben: fallende Taktraten, korrigierte Speicherfehler auf der Karte, ein Job, der plötzlich ein Drittel langsamer läuft, ohne dass Sie einen Grund in Ihrem Code finden.
Karten fallen anders aus als Festplatten. Langsamer und mit mehr Vorwarnung.
Unsere Überwachung beobachtet auf jedem Host Kartentemperatur, Taktverhalten und Fehlerzähler. Wenn eine Karte anfängt, sich falsch zu verhalten, kontaktieren wir Sie, bevor sie ausfällt, und wir planen den Austausch um Ihren Job herum und nicht mittendurch. Wenn die Karte vollständig ausfällt, wird Ihre Instanz auf einem anderen Host am selben Standort neu aufgebaut, wobei Volumes und Adressen erhalten bleiben.
Die Wiederherstellung ist in dieser Produktlinie langsamer als im Rest der Flotte, und es ist wichtig, klar zu sagen, warum: Ein Terabyte Datensatz und ein residentes Modell brauchen echte Minuten, um bewegt und neu geladen zu werden. Planen Sie eher eine Stunde als fünfzehn Minuten ein und bewahren Sie Checkpoints nicht auf der Maschine auf, die gerade brennt.
Warnung vor Ausfall, wo möglich
Fehlerzähler und Takttelemetrie werden kontinuierlich ausgelesen. Die meisten Kartenwechsel finden in einem Fenster statt, das wir vorab mit dem Kunden vereinbart haben.
Volumes und Adressen überleben
Der Neuaufbau übernimmt Ihre NVMe-Inhalte und IP-Adressen. Weder Ihre DNS-Einträge noch Ihre Zertifikate müssen geändert werden.
Gutschriften sind automatisch
Die gleiche vertragliche Verfügbarkeit von 99,99 % gilt hier wie überall sonst, und die Gutschrift erfolgt ohne Antragsformular.
Fragen zu dieser Reihe
Das physische Gerät ist über eine volle x16-Verbindung an Ihre Instanz gebunden. Es gibt kein vGPU-Partitioning, kein Time-Slicing und keinen anderen Mandanten darauf. Ihre Geräteliste zeigt eine Karte, weil es eine Karte ist.
Nein. Karten werden monatlich abgerechnet, und die Mindestlaufzeit beträgt einen Monat. Wenn Ihre Arbeitslast wirklich stoßweise anfällt, ist ein abgerechneter Anbieter günstiger, und es gibt keine Version dieser Konversation, in der wir etwas anderes behaupten.
Keiner, außer Sie fragen danach. Images werden sauber ausgeliefert, und der Treiber wird in Ihrer Instanz installiert, weil die Hälfte unserer GPU-Kunden starke Meinungen zu Versionen hat und die andere Hälfte einen Container mitbringt, der seinen eigenen Treiber enthält.
Nein. Sie sitzen auf demselben Host und in derselben NUMA-Domäne und kommunizieren über PCIe. Für datenparallele Arbeit mit moderatem Gradientenaustausch ist das ausreichend. Für alles, was ein Hochbandbreiten-Karte-zu-Karte-Fabric voraussetzt, ist es das nicht, und Sie sollten Ihre Erwartungen entsprechend dimensionieren.
Nein. Passthrough erfordert einen dafür gebauten Host mit entsprechender PCIe-Topologie und Leistungsbudget. Ein Wechsel zu dieser Produktlinie bedeutet eine neue Instanz und eine Datenkopie.
Das Volume wird gelöscht und die Karte geht zurück in den Pool. Sichern Sie Ihre Checkpoints vor Ablauf der Laufzeit, denn eine gekündigte Instanz ist wirklich weg und nicht irgendwo geparkt, bis Sie Ihre Meinung ändern.
Nehmen Sie eine ganze Karte
Prüfen Sie zuerst die Speicherarithmetik, wählen Sie den Standort mit der Kapazität und bezahlen Sie in Coin. Root-Zugriff in unter einer Minute, die Treiberentscheidung bleibt bei Ihnen, und die ersten sieben Tage sind ohne Angabe von Gründen erstattungsfähig.