Linea tre di cinque

Una scheda, non una fetta

Una GPU condivisa è il lavoro di qualcun altro che finisce prima che inizi il tuo. Ogni scheda in questa linea è passata a un'istanza su un link completo a sedici linee e resta lì finché non annulli, inattiva o no.

Flotta
da€239
DistribuzioneIn meno di un minuto
Disponibile a8
TrafficoIllimitato, uso corretto

A shared GPU is someone else’s job finishing before yours starts. Every card in this line is passed straight through to a single instance and stays there until you cancel.

Prezzo
PianoCore dedicatiMemoriaStorage NVMeGraficaVelocità portaPrezzo
G-ADA
Inference and light training
864 GB1 TB1 × RTX 4000 Ada · 20 GB40 Gbit/s€239.00
/mese
Configura
G-L40SPiù utilizzato
48 GB of VRAM, undivided
16128 GB2 TB1 × L40S · 48 GB40 Gbit/s€749.00
/mese
Configura
G-L40S×2
Two cards, one NUMA node
32256 GB4 TB2 × L40S · 96 GB40 Gbit/s€1420.00
/mese
Configura

I prezzi sono IVA esclusa ove applicabile. Traffico: Illimitato, uso corretto.

EPYC 9354P host · PCIe 4.0 x16 passthrough · no vGPU time-slicing

00

Trentaquattro città, ventinove paesi

I valori di latenza sono mediane misurate dalle nostre sonde, non brochure dei fornitori. Si aggiornano; la pagina si aggiorna quando lo fanno.

01

Il passthrough, e perché conta

La maggior parte della capacità GPU economica è una frazione di scheda passata in una coda. Il numero sulla pagina del prodotto è la memoria della scheda, non la tua, e il throughput che misuri dipende da chi altro si è svegliato stamattina.

Niente vGPU, niente time-slicing, nessuno scheduler tra te e il silicio.

Qui la scheda è vincolata alla tua istanza a livello di hypervisor su un link PCIe 4.0 a sedici linee. L'intero dispositivo è tuo: tutta la memoria, tutte le unità di calcolo, l'intera larghezza di banda del copy engine. Niente è partizionato, niente è in coda e nessun altro tenant appare nella tua lista dispositivi.

La conseguenza pratica è che il tuo benchmark di stasera corrisponde al tuo benchmark di martedì scorso. I lavori di fine-tuning che richiedono due giorni finiscono nel tempo previsto nella tua prima ora. Il lavoro interattivo resta interattivo, perché non c'è un job batch di un altro tenant davanti al tuo.

01

Tutta la VRAM, sempre

Quarantotto gigabyte su una L40S, venti su una RTX 4000 Ada, e nessuno di questi riservato a una partizione hypervisor. Quello che ha la scheda è quello che il tuo processo può indirizzare.

02

L'inattività non ti costa nulla in più

La scheda è tua al mese, non al secondo. Lascia un modello residente per tre settimane tra esperimenti e nessuno lo reclama mentre dormi.

03

Due schede, un host

Il livello a doppia scheda mette entrambi i dispositivi sullo stesso dominio NUMA dello stesso host. Parlano su PCIe piuttosto che su un link scheda-a-scheda, il che è bene sapere prima di pianificare una topologia di training intorno a loro.

04

Il tuo stack

Ti consegniamo una macchina con una scheda dentro e restiamo fuori dai piedi. Driver, container runtime, versioni del framework e kernel sono tuoi. Non esiste un layer gestito che abbia opinioni sul tuo Python.

02

A cosa servono queste schede

Entrambe le schede sono di classe workstation, non la cima di un cluster di training, e il posizionamento onesto ne segue.

Inferenza, fine-tuning, rendering e lavoro numerico batch. In quest'ordine.

Se il tuo modello sta in quarantotto gigabyte, un L40S lo servirà adeguatamente finché continuerai a pagarlo. Se non ci sta, nessun entusiasmo lo farà stare, e il prossimo passo onesto è la quantizzazione, lo sharding sul tier a doppia scheda, o una classe di macchina completamente diversa.

Carico di lavoroQuale schedaIl vincolo reale
Servire un modello quantizzato a utenti realiRTX 4000 AdaMemoria, poi concorrenza delle richieste
Servire un modello di media dimensione a piena precisioneL40SQuarantotto gigabyte sono il soffitto che decide la questione
Fine-tuning con adapterL40SVRAM durante il backward pass, non throughput grezzo
Fine-tuning completo di un modello grandeDue L40S, o da qualche altra parteLa banda da scheda a scheda su PCIe diventa il limite
Rendering batch e encoding videoEntrambeDisco e rete molto più spesso della scheda
Simulazione numerica in doppia precisioneNessuna, di solitoQueste non sono parti a doppia precisione. Prendi core EPYC
03

Who should not buy this

La capacità GPU attira sizing ottimista più di qualsiasi altro prodotto che vendiamo. Tre gruppi di persone dovrebbero ignorare questa linea.

La cosa più utile che possiamo dire ad alcuni clienti è che siamo il negozio sbagliato.

01

Stai addestrando qualcosa di enorme da zero

Il training multi-nodo con interconnessione ad alta banda tra host non è questa cosa. Due schede su PCIe in un singolo host è il nostro tetto, e fingere il contrario farebbe perdere settimane del tuo tempo.

02

Vuoi fatturazione al secondo

Le schede si affittano al mese. Se il tuo utilizzo è davvero venti minuti a settimana, una piattaforma a consumo ti costerà meno di noi, e preferiamo dirlo subito.

03

Il tuo modello non ci sta

Novantasei gigabyte su due schede è il massimo indirizzabile qui. Fai i conti della memoria per pesi, attivazioni e stato dell'ottimizzatore prima di ordinare, non dopo.

04

Ti serve la doppia precisione

Queste sono parti a singola e mista precisione. I codici scientifici che insistono sul throughput FP64 gireranno più veloce su quarantotto core EPYC che su una delle due schede.

05

Vuoi che gestiamo noi lo stack

Non manteniamo il tuo driver, la tua versione di CUDA o la tua matrice di framework. Il componente aggiuntivo di hardening copre la baseline del sistema operativo e si ferma lì.

04

L'host attorno alla scheda

Una GPU affamata è una stufa costosa. L'host conta quanto la scheda, ed è lì che la maggior parte delle offerte GPU economiche taglia silenziosamente i costi.

EPYC 9354P, memoria ECC, NVMe locale alla macchina, porta a quaranta gigabit.

01

Core che possono alimentarla

Da otto a trentadue core EPYC dedicati a seconda del tier, pinnati nello stesso dominio NUMA della scheda. Il caricamento dei dati e il preprocessing sono i soliti motivi per cui un loop di training si blocca, e sono lavoro della CPU.

02

Memoria ECC sull'host

DDR5-4800 registrata, da sessantaquattro a duecentocinquantasei gigabyte. Un lavoro di quarantotto ore è esattamente il tipo di cosa che non dovrebbe essere rovinata da un singolo bit flippato in un buffer del dataloader.

03

NVMe che tiene il passo

Da uno a quattro terabyte di NVMe Gen4 locale, con mirroring. I dataset vengono trasmessi dalla macchina stessa, non attraverso un volume di rete che qualcun altro sta leggendo.

04

Porta da quaranta gigabit

Scaricare un dataset di molti terabyte dovrebbe richiedere una serata. L'uso equo su una porta da quaranta gigabit è di duecentocinquanta terabyte al mese, pubblicato sulla pagina dei prezzi.

05

Console out-of-band

Seriale e VNC tramite tunnel autenticato, inclusi. Quando l'installazione di un driver va storta a mezzanotte, puoi comunque raggiungere la macchina, che è la ragione stessa della sua esistenza.

La scheda è passata attraverso, quindi il driver viene installato all'interno della tua istanza come su qualsiasi altra macchina. Nulla sull'host tocca il tuo framework e un riavvio non rinegozia nulla.

05

Dove sono le schede

Amsterdam, Francoforte, Londra, New York, Dallas, Los Angeles, Singapore e Tokyo. Questi sono i piani con la densità di potenza e il raffreddamento per far funzionare le schede a pieno carico in modo continuo, non a raffiche educate.

Otto siti in sei paesi. Le GPU hanno bisogno di alimentazione e raffreddamento, non di codici postali.

Francoforte è il piano GPU più trafficato che gestiamo e riceve le nuove schede per primo. Dallas è il posto più facile per ottenere capacità con breve preavviso, perché l'energia è economica e il piano è ampio. Los Angeles ha schede ma spesso scarseggia, quindi ordina in anticipo se la rotta verso ovest verso l'Asia è ciò che stai acquistando.

Lo stock si muove davvero su questa linea. Una scheda che risulta disponibile a mezzogiorno potrebbe non esserci la sera, e preferiamo mostrarti un'etichetta di esaurito accurata piuttosto che accettare un ordine che non possiamo evadere questa settimana.

SitoNotesUso tipico
AmsterdamSito più denso della flotta, tutto viene spedito qui per primoInferenza europea con bassa latenza verso gran parte del continente
FrancofortePiano GPU più trafficato, primo a ricevere nuove schedeTraining e fine-tuning dove la capacità conta più dell'ultimo millisecondo
LondraLatenza transatlantica più bassa in EuropaServire utenti su entrambi i lati dell'Atlantico da un unico posto
New YorkAncoraggio costa orientale, gamma completa di prodottiInferenza nordamericana
DallasEnergia economica, piano ampio, capacità più facileLunghi batch e tutto ciò che è sensibile al prezzo
Los AngelesMigliori rotte verso ovest che abbiamo fuori dall'AsiaServire il Pacifico dal Nord America
SingaporeScelta predefinita per il Sud-Est asiaticoInferenza regionale
TokyoTempo di andata e ritorno più stabile nella regioneTraffico giapponese e coreano sensibile alla latenza
06

Lunghi lavori e come non perderne uno

Un fine-tuning di quarantotto ore è una scommessa che per due giorni non vada nulla storto. Struttura il lavoro in modo che perdere la scommessa ti costi un'ora piuttosto che il weekend.

Checkpoint. Lo diremo comunque dopo che l'avrai sentito cento volte.

  1. 01

    Checkpoint su NVMe locale, spesso

    Ogni poche centinaia di passi, sul disco locale, perché è abbastanza veloce che il costo è trascurabile. Un lavoro che non può riprendere è un lavoro che alla fine eseguirai due volte.

  2. 02

    Copia i checkpoint dalla macchina

    L'NVMe locale è con mirroring, non immortale. Un backup fuori nodo scrive in una città diversa ogni notte, ed è l'assicurazione più economica su questa pagina.

  3. 03

    Snapshot prima di toccare il driver

    Gli aggiornamenti di driver e framework sono la causa principale di un ambiente funzionante che diventa non funzionante. Uno snapshot richiede secondi per essere creato e secondi per essere ripristinato.

  4. 04

    Controlla temperatura e clock, non solo la loss

    Le schede riducono la frequenza quando la stanza non è in forma. Se il throughput cala senza modifiche al codice, guarda i valori di clock prima di riscrivere il dataloader.

  5. 05

    Chiedi prima di scalare in orizzontale

    Se il passo successivo richiede quattro o otto schede, spiega al supporto cosa stai cercando di fare. A volte la risposta è una macchina bare-metal, e occasionalmente la risposta è che non siamo il fornitore giusto.

07

Quando l'hardware si guasta

Le GPU di solito degradano piuttosto che morire: clock in calo, errori di memoria corretti sulla scheda, un job che improvvisamente gira un terzo più lento per nessuna ragione che puoi trovare nel tuo codice.

Le schede si guastano diversamente dai dischi. Più lentamente, e con più preavviso.

Il nostro monitoraggio controlla temperatura, comportamento dei clock e contatori di errori su ogni host. Quando una scheda inizia a comportarsi male, ti contattiamo prima che smetta di funzionare, e programmiamo la sostituzione attorno al tuo job piuttosto che nel mezzo. Se la scheda si guasta del tutto, la tua istanza viene ricostruita su un altro host nello stesso sito con volumi e indirizzi intatti.

Il ripristino su questa linea è più lento che altrove nella flotta, ed è giusto essere chiari sul perché: un terabyte di dataset e un modello residente richiedono minuti reali per essere spostati e ricaricati. Prevedi un'ora piuttosto che quindici minuti, e tieni i checkpoint da qualche parte diversa dalla macchina che sta andando a fuoco.

01

Preavviso prima del guasto, dove possibile

I contatori di errori e la telemetria dei clock vengono letti continuamente. La maggior parte delle sostituzioni di schede avviene in una finestra concordata con il cliente in anticipo.

02

Volumi e indirizzi sopravvivono

La ricostruzione trasporta i contenuti NVMe e gli indirizzi IP. Nulla nel tuo DNS o nei tuoi certificati deve cambiare.

03

I crediti sono automatici

Lo stesso uptime contrattuale del 99.99% si applica qui come ovunque, e il credito arriva senza modulo di reclamo.

08

Domande su questa linea

Il dispositivo fisico è vincolato alla tua istanza su un collegamento completo a sedici lane. Non c'è partizionamento vGPU, nessun time-slicing e nessun altro tenant su di essa. La tua lista dispositivi mostra una scheda perché c'è una scheda.

No. Le schede sono mensili, e l'impegno minimo è un mese. Se il tuo carico di lavoro è realmente a raffica, un provider a consumo sarà più economico, e non esiste una versione di questa conversazione in cui fingiamo il contrario.

Nessuno, a meno che tu non lo chieda. Le immagini vengono fornite pulite e il driver si installa all'interno della tua istanza, perché metà dei nostri clienti GPU ha opinioni forti sulle versioni e l'altra metà ha un container che porta il proprio.

No. Si trovano sullo stesso host e nello stesso dominio NUMA, e comunicano tramite PCIe. Per lavoro data-parallel con scambio di gradienti modesto va bene. Per qualsiasi cosa che presuppone una fabric card-to-card ad alta larghezza di banda, non va bene, e dovresti dimensionare le tue aspettative di conseguenza.

No. Il passthrough richiede che l'host sia costruito per questo, con la topologia PCIe e il budget di alimentazione in atto. Passare a questa linea significa una nuova istanza e una copia dei dati.

Il volume viene cancellato e la scheda torna nel pool. Porta via i checkpoint prima della fine del termine, perché un'istanza annullata è davvero sparita piuttosto che parcheggiata da qualche parte in attesa che cambi idea.

Pronto quando lo sei

Prendi una scheda intera

Controlla prima l'aritmetica della memoria, scegli il sito con la capacità e paga in moneta. L'accesso root arriva in meno di un minuto, la decisione sul driver resta tua, e i primi sette giorni sono rimborsabili senza motivo.