Linie drei von fünf

Eine Karte, kein Teil davon

Eine geteilte GPU bedeutet, dass die Arbeit eines anderen zuerst fertig wird. Jede Karte in dieser Linie wird über eine volle 16-Lane-Verbindung an eine Instanz durchgereicht und bleibt dort, bis Sie kündigen, ob idle oder nicht.

Flotte
von€239
BereitstellungUnter einer Minute
Verfügbar bei8
TrafficUnbegrenzt, faire Nutzung

A shared GPU is someone else’s job finishing before yours starts. Every card in this line is passed straight through to a single instance and stays there until you cancel.

Preis
TarifDedizierte KerneArbeitsspeicherNVMe-SpeicherGrafikPortgeschwindigkeitPreis
G-ADA
Inference and light training
864 GB1 TB1 × RTX 4000 Ada · 20 GB40 Gbit/s€239.00
/Monat
Konfigurieren
G-L40SAm meisten genommen
48 GB of VRAM, undivided
16128 GB2 TB1 × L40S · 48 GB40 Gbit/s€749.00
/Monat
Konfigurieren
G-L40S×2
Two cards, one NUMA node
32256 GB4 TB2 × L40S · 96 GB40 Gbit/s€1420.00
/Monat
Konfigurieren

Preise zuzüglich MwSt., sofern anwendbar. Traffic: Unbegrenzt, faire Nutzung.

EPYC 9354P host · PCIe 4.0 x16 passthrough · no vGPU time-slicing

00

Vierunddreißig Städte, neunundzwanzig Länder

Latenzwerte sind gemessene Mediane von unseren eigenen Sonden, nicht Verkaufsbroschüren. Sie bewegen sich; die Seite aktualisiert sich, wenn sie es tun.

01

Passthrough und warum es wichtig ist

Die meisten billigen GPU-Kapazitäten sind ein Bruchteil einer Karte, der durch eine Warteschlange gereicht wird. Die Zahl auf der Produktseite ist der Speicher der Karte, nicht Ihrer, und der Durchsatz, den Sie messen, hängt davon ab, wer sonst heute Morgen aufgewacht ist.

Kein vGPU, kein Time-Slicing, kein Scheduler zwischen Ihnen und dem Silizium.

Hier ist die Karte auf Hypervisor-Ebene über eine 16-Lane-PCIe-4.0-Verbindung an Ihre Instanz gebunden. Das gesamte Gerät gehört Ihnen: der gesamte Speicher, alle Recheneinheiten, die volle Copy-Engine-Bandbreite. Nichts ist partitioniert, nichts ist in der Warteschlange, und kein anderer Mandant erscheint in Ihrer Geräteliste.

Die praktische Konsequenz ist, dass Ihr Benchmark heute Abend Ihrem Benchmark von letztem Dienstag entspricht. Feintuning-Läufe, die zwei Tage dauern, sind in der Zeit fertig, die Ihre erste Stunde vorhergesagt hat. Interaktive Arbeit bleibt interaktiv, weil kein Batch-Job eines anderen Mandanten vor Ihrem liegt.

01

Der gesamte VRAM, die ganze Zeit

Achtundvierzig Gigabyte auf einer L40S, zwanzig auf einer RTX 4000 Ada, und nichts davon ist für eine Hypervisor-Partition reserviert. Was die Karte hat, ist das, was Ihr Prozess adressieren kann.

02

Leerlauf kostet Sie nichts extra

Die Karte gehört Ihnen pro Monat, nicht pro Sekunde. Lassen Sie ein Modell drei Wochen zwischen Experimenten resident und niemand holt es sich zurück, während Sie schlafen.

03

Zwei Karten, ein Host

Die Zwei-Karten-Stufe platziert beide Geräte in derselben NUMA-Domäne desselben Hosts. Sie kommunizieren über PCIe statt über eine Karte-zu-Karte-Verbindung, was man wissen sollte, bevor man eine Trainings-Topologie um sie plant.

04

Ihr eigener Stack

Wir übergeben Ihnen eine Maschine mit einer Karte darin und bleiben Ihnen aus dem Weg. Treiber, Container-Runtime, Framework-Versionen und Kernel gehören Ihnen. Es gibt keine verwaltete Ebene, die Meinungen über Ihr Python hat.

02

Wofür diese Karten geeignet sind

Beide Karten sind Workstation-Klasse und nicht die Spitze eines Trainingsclusters, und die ehrliche Positionierung folgt daraus.

Inferenz, Feintuning, Rendering und numerische Stapelverarbeitung. In dieser Reihenfolge.

Wenn Ihr Modell in achtundvierzig Gigabyte passt, wird eine L40S es kompetent bedienen, solange Sie dafür zahlen. Wenn es nicht passt, macht keine Begeisterung es passend, und der nächste ehrliche Schritt ist Quantisierung, Aufteilung auf die Zwei-Karten-Stufe oder eine völlig andere Maschinenklasse.

WorkloadWelche KarteDie eigentliche Grenze
Quantisiertes Modell für echte Benutzer ausliefernRTX 4000 AdaSpeicher, dann Anfrageparallelität
Modell mittlerer Größe in voller Präzision ausliefernL40SAchtundvierzig Gigabyte sind die Obergrenze, die es entscheidet
Feintuning mit AdapternL40SVRAM während des Rückwärtsdurchgangs, nicht roher Durchsatz
Vollständiges Feintuning eines großen ModellsZwei L40S oder woandersKarte-zu-Karte-Bandbreite über PCIe wird zur Grenze
Stapelrendering und Video-EncodingEgal welcheFestplatte und Netzwerk viel öfter als die Karte
Numerische Simulation in doppelter GenauigkeitNormalerweise keineDas sind keine Doppelpräzisionsteile. Nehmen Sie EPYC-Kerne
03

Wer dies nicht kaufen sollte

GPU-Kapazität zieht optimistische Größenplanung mehr an als jedes andere Produkt, das wir verkaufen. Drei Gruppen von Leuten sollten an dieser Reihe vorbeigehen.

Das Nützlichste, was wir manchen Kunden sagen können, ist, dass wir der falsche Laden sind.

01

Sie trainieren etwas Enormes von Grund auf

Multi-Node-Training mit Hochgeschwindigkeitsverbindung zwischen Hosts ist nicht das, was das ist. Zwei Karten über PCIe auf einem Host ist unsere Obergrenze, und etwas anderes zu behaupten würde Wochen Ihrer Zeit verschwenden.

02

Sie möchten Abrechnung pro Sekunde

Karten werden monatlich gemietet. Wenn Ihre Nutzung wirklich zwanzig Minuten pro Woche beträgt, wird eine abgerechnete Plattform weniger kosten als wir, und wir sagen das lieber jetzt.

03

Ihr Modell passt nicht

Sechsundneunzig Gigabyte über zwei Karten sind das hier maximal adressierbare. Rechnen Sie die Speicherarithmetik für Gewichte, Aktivierungen und Optimiererzustand vor der Bestellung durch, nicht danach.

04

Sie benötigen doppelte Genauigkeit

Das sind Einzelpräzisions- und gemischtpräzisionsteile. Wissenschaftliche Codes, die auf FP64-Durchsatz bestehen, laufen schneller auf achtundvierzig EPYC-Kernen als auf jeder der beiden Karten.

05

Sie möchten, dass wir den Stack verwalten

Wir pflegen weder Ihren Treiber, noch Ihre CUDA-Version oder Ihre Framework-Matrix. Das Härtungs-Add-on deckt die Betriebssystem-Basislinie ab und hört dort auf.

04

Der Host um die Karte

Eine ausgehungerte GPU ist ein teurer Heizlüfter. Der Host ist so wichtig wie die Karte, und genau dort sparen die meisten billigen GPU-Angebote leise Kosten.

EPYC 9354P, ECC-Speicher, NVMe lokal zur Maschine, 40-Gigabit-Port.

01

Kerne, die sie füttern können

Acht bis zweiunddreißig dedizierte EPYC-Kerne je nach Stufe, in derselben NUMA-Domäne wie die Karte gepinnt. Datenladen und Vorverarbeitung sind der übliche Grund, warum eine Trainingsschleife ins Stocken gerät, und das ist CPU-Arbeit.

02

ECC-Speicher auf dem Host

Registrierter DDR5-4800, vierundsechzig bis zweihundertsechsundfünfzig Gigabyte. Ein 48-Stunden-Job ist genau die Art von Sache, die nicht durch ein einzelnes gekipptes Bit in einem Datenlader-Puffer ruiniert werden sollte.

03

NVMe, das mithält

Ein bis vier Terabyte lokaler Gen4-NVMe, gespiegelt. Datensätze werden von der Maschine selbst gestreamt und nicht über ein Netzwerk-Volume, das auch jemand anderes liest.

04

Ein 40-Gigabit-Port

Das Herunterladen eines Multi-Terabyte-Datensatzes sollte einen Abend dauern. Fair Use auf einem 40-Gigabit-Port liegt bei 250 Terabyte pro Monat, veröffentlicht auf der Preisseite.

05

Out-of-Band-Konsole

Seriell und VNC über einen authentifizierten Tunnel, inklusive. Wenn um Mitternacht eine Treiberinstallation schiefgeht, kannst du die Maschine trotzdem erreichen – das ist der eigentliche Grund, warum es sie gibt.

Die Karte wird durchgereicht, der Treiber wird also wie bei jeder anderen Maschine in deiner Instanz installiert. Nichts auf dem Host berührt dein Framework, und ein Neustart verhandelt nichts neu.

05

Wo die Karten stehen

Amsterdam, Frankfurt, London, New York, Dallas, Los Angeles, Singapur und Tokio. Das sind die Standorte mit der Energiedichte und Kühlung, um Karten dauerhaft unter Volllast zu betreiben, statt in höflichen Stößen.

Acht Standorte in sechs Ländern. GPUs brauchen Strom und Kühlung, keine Postleitzahlen.

Frankfurt ist der GPU-Standort mit dem höchsten Durchsatz und bekommt neue Karten zuerst. Dallas ist der einfachste Ort, um kurzfristig Kapazität zu bekommen, weil Strom dort günstig ist und die Fläche groß. Los Angeles hat Karten, ist aber oft ausgelastet – also früh bestellen, wenn du die Westroute nach Asien kaufen willst.

Bei dieser Linie bewegt sich der Bestand wirklich. Eine Karte, die mittags als verfügbar angezeigt wird, kann abends weg sein. Wir zeigen dir lieber ein korrektes Ausverkauft-Label, als eine Bestellung anzunehmen, die wir diese Woche nicht füllen können.

StandortAnmerkungenTypische Nutzung
AmsterdamDichtester Standort der Flotte, alles wird hier zuerst ausgeliefertEuropäische Inferenz mit niedriger Latenz zum größten Teil des Kontinents
FrankfurtGPU-Standort mit dem höchsten Durchsatz, bekommt neue Karten zuerstTraining und Feintuning, wenn Kapazität wichtiger ist als die letzte Millisekunde
LondonNiedrigste transatlantische Latenz in EuropaBedienung von Nutzern auf beiden Seiten des Atlantiks von einem Ort aus
New YorkAnker der Ostküste, volles ProduktsortimentNordamerikanische Inferenz
DallasGünstiger Strom, große Fläche, einfachste KapazitätLange Batch-Jobs und alles Preisbewusste
Los AngelesBeste Westrouten, die wir außerhalb Asiens habenBedienung des Pazifikraums aus Nordamerika
SingapurStandardwahl für SüdostasienRegionale Inferenz
TokioStabilste Round-Trip-Zeit in der RegionLatenzempfindlicher japanischer und koreanischer Traffic
06

Lange Jobs und wie man keinen verliert

Ein 48-Stunden-Feintuning ist eine Wette darauf, dass zwei Tage lang nichts schiefgeht. Strukturiere den Job so, dass ein Verlust der Wette dich eine Stunde kostet statt das Wochenende.

Checkpoint. Wir werden es auch dann sagen, wenn du es hundertmal gehört hast.

  1. 01

    Checkpoint auf lokales NVMe, oft

    Alle paar hundert Schritte auf die lokale Platte, denn das ist schnell genug, dass die Kosten vernachlässigbar sind. Ein Job, der nicht fortgesetzt werden kann, ist ein Job, den du letztendlich zweimal ausführst.

  2. 02

    Checkpoints von der Box kopieren

    Lokales NVMe ist gespiegelt, nicht unsterblich. Off-Node-Backups schreiben nachts in eine andere Stadt, und das ist die günstigste Versicherung auf dieser Seite.

  3. 03

    Snapshot, bevor du den Treiber anfasst

    Treiber- und Framework-Upgrades sind die Hauptursache dafür, dass aus einer funktionierenden Umgebung eine nicht funktionierende wird. Ein Snapshot dauert Sekunden zu erstellen und Sekunden zum Wiederherstellen.

  4. 04

    Temperatur und Taktraten beobachten, nicht nur den Verlust

    Karten drosseln, wenn der Raum einen schlechten Tag hat. Wenn Ihr Durchsatz sinkt, ohne dass sich Ihr Code ändert, prüfen Sie die Taktraten, bevor Sie den Dataloader umschreiben.

  5. 05

    Fragen Sie, bevor Sie horizontal skalieren

    Wenn der nächste Schritt vier oder acht Karten sind, teilen Sie dem Support mit, was Sie erreichen möchten. Manchmal ist die Antwort eine Bare-Metal-Maschine, und gelegentlich ist die Antwort, dass wir nicht der richtige Anbieter sind.

07

Wenn die Hardware ausfällt

GPUs degradieren meist eher, als dass sie sterben: fallende Taktraten, korrigierte Speicherfehler auf der Karte, ein Job, der plötzlich ein Drittel langsamer läuft, ohne dass Sie einen Grund in Ihrem Code finden.

Karten fallen anders aus als Festplatten. Langsamer und mit mehr Vorwarnung.

Unsere Überwachung beobachtet auf jedem Host Kartentemperatur, Taktverhalten und Fehlerzähler. Wenn eine Karte anfängt, sich falsch zu verhalten, kontaktieren wir Sie, bevor sie ausfällt, und wir planen den Austausch um Ihren Job herum und nicht mittendurch. Wenn die Karte vollständig ausfällt, wird Ihre Instanz auf einem anderen Host am selben Standort neu aufgebaut, wobei Volumes und Adressen erhalten bleiben.

Die Wiederherstellung ist in dieser Produktlinie langsamer als im Rest der Flotte, und es ist wichtig, klar zu sagen, warum: Ein Terabyte Datensatz und ein residentes Modell brauchen echte Minuten, um bewegt und neu geladen zu werden. Planen Sie eher eine Stunde als fünfzehn Minuten ein und bewahren Sie Checkpoints nicht auf der Maschine auf, die gerade brennt.

01

Warnung vor Ausfall, wo möglich

Fehlerzähler und Takttelemetrie werden kontinuierlich ausgelesen. Die meisten Kartenwechsel finden in einem Fenster statt, das wir vorab mit dem Kunden vereinbart haben.

02

Volumes und Adressen überleben

Der Neuaufbau übernimmt Ihre NVMe-Inhalte und IP-Adressen. Weder Ihre DNS-Einträge noch Ihre Zertifikate müssen geändert werden.

03

Gutschriften sind automatisch

Die gleiche vertragliche Verfügbarkeit von 99,99 % gilt hier wie überall sonst, und die Gutschrift erfolgt ohne Antragsformular.

08

Fragen zu dieser Reihe

Das physische Gerät ist über eine volle x16-Verbindung an Ihre Instanz gebunden. Es gibt kein vGPU-Partitioning, kein Time-Slicing und keinen anderen Mandanten darauf. Ihre Geräteliste zeigt eine Karte, weil es eine Karte ist.

Nein. Karten werden monatlich abgerechnet, und die Mindestlaufzeit beträgt einen Monat. Wenn Ihre Arbeitslast wirklich stoßweise anfällt, ist ein abgerechneter Anbieter günstiger, und es gibt keine Version dieser Konversation, in der wir etwas anderes behaupten.

Keiner, außer Sie fragen danach. Images werden sauber ausgeliefert, und der Treiber wird in Ihrer Instanz installiert, weil die Hälfte unserer GPU-Kunden starke Meinungen zu Versionen hat und die andere Hälfte einen Container mitbringt, der seinen eigenen Treiber enthält.

Nein. Sie sitzen auf demselben Host und in derselben NUMA-Domäne und kommunizieren über PCIe. Für datenparallele Arbeit mit moderatem Gradientenaustausch ist das ausreichend. Für alles, was ein Hochbandbreiten-Karte-zu-Karte-Fabric voraussetzt, ist es das nicht, und Sie sollten Ihre Erwartungen entsprechend dimensionieren.

Nein. Passthrough erfordert einen dafür gebauten Host mit entsprechender PCIe-Topologie und Leistungsbudget. Ein Wechsel zu dieser Produktlinie bedeutet eine neue Instanz und eine Datenkopie.

Das Volume wird gelöscht und die Karte geht zurück in den Pool. Sichern Sie Ihre Checkpoints vor Ablauf der Laufzeit, denn eine gekündigte Instanz ist wirklich weg und nicht irgendwo geparkt, bis Sie Ihre Meinung ändern.

Bereit, wenn Sie es sind

Nehmen Sie eine ganze Karte

Prüfen Sie zuerst die Speicherarithmetik, wählen Sie den Standort mit der Kapazität und bezahlen Sie in Coin. Root-Zugriff in unter einer Minute, die Treiberentscheidung bleibt bei Ihnen, und die ersten sieben Tage sind ohne Angabe von Gründen erstattungsfähig.