Gamme trois sur cinq

Une carte, pas une part de carte

Un GPU partagé, c'est le travail de quelqu'un d'autre qui se termine avant que le vôtre ne commence. Chaque carte de cette gamme est passée à une seule instance via un lien complet de seize voies et y reste jusqu'à ce que vous annuliez, inutilisée ou non.

Parc
à partir de€239
DéploiementMoins d'une minute
Disponible à8
TraficIllimité, usage raisonnable

A shared GPU is someone else’s job finishing before yours starts. Every card in this line is passed straight through to a single instance and stays there until you cancel.

Prix
FormuleCœurs dédiésMémoireStockage NVMeGraphiquesDébit du portPrix
G-ADA
Inference and light training
864 GB1 TB1 × RTX 4000 Ada · 20 GB40 Gbit/s€239.00
/mois
Configurer
G-L40SLe plus pris
48 GB of VRAM, undivided
16128 GB2 TB1 × L40S · 48 GB40 Gbit/s€749.00
/mois
Configurer
G-L40S×2
Two cards, one NUMA node
32256 GB4 TB2 × L40S · 96 GB40 Gbit/s€1420.00
/mois
Configurer

Prix hors TVA le cas échéant. Trafic: Illimité, usage raisonnable.

EPYC 9354P host · PCIe 4.0 x16 passthrough · no vGPU time-slicing

00

Trente-quatre villes, vingt-neuf pays

Les chiffres de latence sont des médianes mesurées depuis nos propres sondes, pas des brochures de fournisseurs. Ils bougent ; la page se met à jour en conséquence.

01

Passthrough, et pourquoi c'est important

La plupart des capacités GPU bon marché sont une fraction de carte distribuée dans une file d'attente. Le nombre sur la page produit est la mémoire de la carte, pas la vôtre, et le débit que vous mesurez dépend de qui d'autre s'est réveillé ce matin.

Pas de vGPU, pas de time-slicing, pas d'ordonnanceur entre vous et le silicium.

Ici, la carte est liée à votre instance au niveau de l'hyperviseur via un lien PCIe 4.0 de seize voies. Tout le périphérique est à vous : toute la mémoire, toutes les unités de calcul, toute la bande passante du moteur de copie. Rien n'est partitionné, rien n'est mis en file d'attente, et aucun autre locataire n'apparaît dans votre liste de périphériques.

La conséquence pratique est que votre benchmark de ce soir correspond à votre benchmark de mardi dernier. Les exécutions de fine-tuning qui prennent deux jours se terminent dans le temps que votre première heure a prédit. Le travail interactif reste interactif, car il n'y a pas de travail batch d'un autre locataire devant le vôtre.

01

Toute la VRAM, tout le temps

Quarante-huit gigaoctets sur une L40S, vingt sur une RTX 4000 Ada, et aucune réservée pour une partition hyperviseur. Ce que la carte a, c'est ce que votre processus peut adresser.

02

Le ralenti ne vous coûte rien de plus

La carte est à vous au mois, pas à la seconde. Laissez un modèle résident trois semaines entre deux expériences et personne ne le réclame pendant que vous dormez.

03

Deux cartes, un hôte

Le palier double carte place les deux périphériques dans le même domaine NUMA du même hôte. Ils communiquent via PCIe plutôt que via un lien carte-à-carte, ce qu'il faut savoir avant de planifier une topologie d'entraînement autour d'eux.

04

Votre propre pile

Nous vous remettons une machine avec une carte à l'intérieur et nous nous tenons à l'écart. Pilotes, runtime de conteneur, versions de framework et noyau vous appartiennent. Il n'y a pas de couche managée ayant des opinions sur votre Python.

02

Ce à quoi ces cartes conviennent

Les deux cartes sont de classe workstation plutôt que le sommet d'un cluster d'entraînement, et le positionnement honnête découle de cela.

Inférence, fine-tuning, rendu et travail numérique par lots. Dans cet ordre.

Si votre modèle tient dans quarante-huit gigaoctets, un L40S le servira correctement aussi longtemps que vous continuerez à payer pour cela. S'il n'y tient pas, aucun enthousiasme ne le fera tenir, et la prochaine étape honnête est la quantification, le sharding sur le palier à deux cartes, ou une toute autre classe de machine.

Charge de travailQuelle carteLa vraie contrainte
Servir un modèle quantisé à des utilisateurs réelsRTX 4000 AdaMémoire, puis concurrence des requêtes
Servir un modèle de taille moyenne en pleine précisionL40SQuarante-huit gigaoctets est le plafond qui décide
Fine-tuning avec adaptateursL40SVRAM pendant la passe arrière, pas le débit brut
Full fine-tune d'un grand modèleDeux L40S, ou ailleursLa bande passante carte-à-carte sur PCIe devient la limite
Rendu par lots et encodage vidéoL'une ou l'autreDisque et réseau bien plus souvent que la carte
Simulation numérique en double précisionNi l'une ni l'autre, généralementCe ne sont pas des pièces en double précision. Prenez des cœurs EPYC
03

Qui ne devrait pas acheter cela

La capacité GPU attire une évaluation plus optimiste que tout autre produit que nous vendons. Trois groupes de personnes devraient passer leur chemin devant cette ligne.

La chose la plus utile que nous puissions dire à certains clients est que nous sommes la mauvaise boutique.

01

Vous entraînez quelque chose d'énorme à partir de zéro

L'entraînement multi-nœuds avec une interconnectivité à haute bande passante entre hôtes n'est pas ce que c'est. Deux cartes sur PCIe sur un seul hôte est notre plafond, et prétendre le contraire vous ferait perdre des semaines de votre temps.

02

Vous voulez une facturation à la seconde

Les cartes sont louées au mois. Si votre utilisation est réellement de vingt minutes par semaine, une plateforme à compteur vous coûtera moins cher que nous, et nous préférons le dire maintenant.

03

Votre modèle ne tient pas

Quatre-vingt-seize gigaoctets sur deux cartes est le maximum adressable ici. Calculez l'arithmétique mémoire pour les poids, les activations et l'état de l'optimiseur avant de commander, pas après.

04

Vous avez besoin de la double précision

Ce sont des pièces en simple précision et en précision mixte. Les codes scientifiques qui insistent sur le débit FP64 s'exécuteront plus vite sur quarante-huit cœurs EPYC que sur l'une ou l'autre carte.

05

Vous voulez que nous gérions la pile

Nous ne maintenons ni votre pilote, ni votre version CUDA, ni votre matrice de framework. Le module complémentaire de durcissement couvre la ligne de base du système d'exploitation et s'arrête là.

04

L'hôte autour de la carte

Un GPU affamé est un chauffage d'appoint coûteux. L'hôte compte autant que la carte, et c'est là que la plupart des offres GPU bon marché réduisent discrètement les coûts.

EPYC 9354P, mémoire ECC, NVMe local à la machine, port quarante gigabits.

01

Des cœurs qui peuvent l'alimenter

Huit à trente-deux cœurs EPYC dédiés selon le palier, épinglés dans le même domaine NUMA que la carte. Le chargement et le prétraitement des données sont la raison habituelle du blocage d'une boucle d'entraînement, et ce sont des tâches CPU.

02

Mémoire ECC sur l'hôte

DDR5-4800 enregistrée, soixante-quatre à deux cent cinquante-six gigaoctets. Un travail de quarante-huit heures est exactement le genre de chose qui ne devrait pas être défait par un bit inversé dans un tampon de dataloader.

03

NVMe qui suit le rythme

Un à quatre téraoctets de NVMe Gen4 local, en miroir. Les jeux de données sont diffusés depuis la machine elle-même plutôt que via un volume réseau que quelqu'un d'autre est en train de lire.

04

Un port quarante gigabits

Télécharger un jeu de données de plusieurs téraoctets devrait prendre une soirée. L'usage raisonnable sur un port quarante gigabits est de deux cent cinquante téraoctets par mois, publié sur la page de tarification.

05

Console hors-bande

Série et VNC via un tunnel authentifié, inclus. Quand une installation de pilote échoue à minuit, vous pouvez toujours accéder à la machine, ce qui est la raison même de son existence.

La carte est passée en direct, donc le pilote est installé à l'intérieur de votre instance comme sur toute autre machine. Rien sur l'hôte ne touche à votre environnement, et un redémarrage ne renégocie rien.

05

Où se trouvent les cartes

Amsterdam, Francfort, Londres, New York, Dallas, Los Angeles, Singapour et Tokyo. Voilà les salles avec la densité de puissance et le refroidissement nécessaires pour faire fonctionner les cartes à pleine charge en continu plutôt que par à-coups polis.

Huit sites dans six pays. Les GPU ont besoin d'électricité et de refroidissement, pas de codes postaux.

Francfort est la salle GPU la plus occupée que nous exploitons et reçoit les nouvelles cartes en premier. Dallas est l'endroit le plus facile pour obtenir de la capacité à court terme, car l'électricité y est bon marché et la salle est vaste. Los Angeles héberge des cartes mais est souvent en rupture, alors commandez tôt si la route vers l'ouest de l'Asie est ce que vous achetez.

Le stock bouge réellement sur cette gamme. Une carte affichée comme disponible à midi peut ne plus l'être le soir, et nous préférons vous montrer une étiquette précise de rupture de stock plutôt que de prendre une commande que nous ne pouvons pas honorer cette semaine.

SiteNotesUtilisation typique
AmsterdamSite le plus dense de la flotte, tout y est expédié en premierInférence européenne avec faible latence vers la majeure partie du continent
FrancfortSalle GPU la plus occupée, première à recevoir les nouvelles cartesEntraînement et affinage où la capacité compte plus que la dernière milliseconde
LondresLatence transatlantique la plus basse d'EuropeServir les utilisateurs des deux côtés de l'Atlantique depuis un seul endroit
New YorkAncre de la côte Est, gamme complète de produitsInférence nord-américaine
DallasÉlectricité bon marché, grande salle, capacité la plus facileTravaux batch longs et tout ce qui est sensible au prix
Los AngelesMeilleures routes vers l'ouest que nous ayons hors d'AsieServir le pourtour du Pacifique depuis l'Amérique du Nord
SingapourChoix par défaut pour l'Asie du Sud-EstInférence régionale
TokyoTemps de trajet aller-retour le plus stable de la régionTrafic japonais et coréen sensible à la latence
06

Tâches longues, et comment ne pas en perdre une

Un affinage de quarante-huit heures est un pari sur le fait que rien ne va mal pendant deux jours. Structurez la tâche pour que perdre le pari vous coûte une heure plutôt que le week-end.

Point de contrôle. Nous le dirons encore après que vous l'ayez entendu cent fois.

  1. 01

    Point de contrôle sur NVMe local, souvent

    Toutes les quelques centaines d'étapes, sur le disque local, car c'est assez rapide pour que le coût soit négligeable. Une tâche qui ne peut pas reprendre est une tâche que vous finirez par exécuter deux fois.

  2. 02

    Copier les points de contrôle hors de la machine

    Le NVMe local est en miroir, pas immortel. Une sauvegarde hors nœud écrit dans une autre ville chaque nuit, et c'est l'assurance la moins chère de cette page.

  3. 03

    Instantané avant de toucher au pilote

    Les mises à niveau de pilotes et de frameworks sont la principale cause pour laquelle un environnement fonctionnel devient non fonctionnel. Un instantané prend quelques secondes à créer et quelques secondes à restaurer.

  4. 04

    Surveillez la température et les horloges, pas seulement les pertes

    Les cartes réduisent leur fréquence quand la salle passe une mauvaise journée. Si votre débit chute sans modification de votre code, regardez les valeurs d'horloge avant de réécrire le dataloader.

  5. 05

    Demandez avant de passer à l'échelle horizontale

    Si la prochaine étape consiste à passer à quatre ou huit cartes, expliquez au support ce que vous essayez de faire. Parfois, la réponse est une machine bare-metal, et parfois la réponse est que nous ne sommes pas le bon fournisseur.

07

Quand le matériel tombe en panne

Les GPU ont tendance à se dégrader plutôt qu'à mourir : horloges en baisse, erreurs mémoire corrigées sur la carte, un travail qui tourne soudainement un tiers plus lentement pour une raison que vous ne trouvez pas dans votre code.

Les cartes tombent en panne différemment des disques. Plus lentement, et avec plus d'avertissement.

Notre surveillance surveille la température de la carte, le comportement de l'horloge et les compteurs d'erreurs sur chaque hôte. Lorsqu'une carte commence à mal se comporter, nous vous contactons avant qu'elle ne cesse de fonctionner, et nous planifions le remplacement autour de votre travail plutôt qu'en plein milieu. Lorsque la carte tombe en panne complètement, votre instance est reconstruite sur un autre hôte du même site, avec ses volumes et ses adresses intacts.

La récupération sur cette ligne est plus lente qu'ailleurs dans la flotte, et il vaut la peine d'être clair sur pourquoi : un téraoctet de données et un modèle résident prennent de vraies minutes à déplacer et à recharger. Prévoyez une heure plutôt que quinze minutes, et conservez vos points de contrôle ailleurs que sur la machine en feu.

01

Avertissement avant panne, si possible

Les compteurs d'erreurs et la télémétrie d'horloge sont lus en continu. La plupart des remplacements de cartes se produisent dans une fenêtre que nous avons convenue avec le client à l'avance.

02

Les volumes et les adresses survivent

La reconstruction conserve le contenu de vos NVMe et vos adresses IP. Rien dans votre DNS ou vos certificats ne doit changer.

03

Les crédits sont automatiques

La même disponibilité contractuelle de 99,99 % s'applique ici comme partout ailleurs, et le crédit est accordé sans formulaire de réclamation.

08

Questions sur cette gamme

Le périphérique physique est lié à votre instance via un lien complet de seize lanes. Il n'y a pas de partitionnement vGPU, pas de découpage temporel et aucun autre locataire dessus. Votre liste de périphériques affiche une carte car il y a une carte.

Non. Les cartes sont mensuelles, et l'engagement le plus court est d'un mois. Si votre charge de travail est vraiment en rafales, un fournisseur à la consommation sera moins cher, et il n'y a pas de version de cette conversation où nous prétendons le contraire.

Aucun, sauf si vous le demandez. Les images sont livrées proprement et le pilote s'installe dans votre instance, car la moitié de nos clients GPU ont des opinions tranchées sur les versions et l'autre moitié a un conteneur qui embarque le sien.

Non. Elles sont sur le même hôte et le même domaine NUMA, et elles communiquent via PCIe. Pour un travail parallèle de données avec un échange de gradients modeste, c'est suffisant. Pour tout ce qui suppose un fabric carte-à-carte à haute bande passante, ce ne l'est pas, et vous devez adapter vos attentes en conséquence.

Non. Le passthrough nécessite que l'hôte soit construit pour cela, avec la topologie PCIe et le budget d'alimentation en place. Passer à cette ligne implique une nouvelle instance et une copie des données.

Le volume est effacé et la carte retourne dans le pool. Récupérez vos points de contrôle avant la fin du terme, car une instance annulée est réellement supprimée plutôt que mise de côté en attendant que vous changiez d'avis.

Prêt quand vous l'êtes

Prenez une carte entière

Vérifiez d'abord l'arithmétique de la mémoire, choisissez le site avec la capacité, et payez en pièces. L'accès root arrive en moins d'une minute, la décision du pilote vous appartient, et les sept premiers jours sont remboursables sans raison.