Línea tres de cinco

Una tarjeta, no una porción de una

Una GPU compartida es que el trabajo de otra persona termine antes de que comience el tuyo. Cada tarjeta de esta línea se pasa a una instancia a través de un enlace completo de dieciséis líneas y permanece allí hasta que canceles, esté inactiva o no.

Flota
desde€239
ImplementaciónMenos de un minuto
Disponible en8
TráficoSin medir, uso justo

A shared GPU is someone else’s job finishing before yours starts. Every card in this line is passed straight through to a single instance and stays there until you cancel.

Precio
PlanNúcleos dedicadosMemoriaAlmacenamiento NVMeGráficosVelocidad de puertoPrecio
G-ADA
Inference and light training
864 GB1 TB1 × RTX 4000 Ada · 20 GB40 Gbit/s€239.00
/mes
Configurar
G-L40SLa mayoría contratado
48 GB of VRAM, undivided
16128 GB2 TB1 × L40S · 48 GB40 Gbit/s€749.00
/mes
Configurar
G-L40S×2
Two cards, one NUMA node
32256 GB4 TB2 × L40S · 96 GB40 Gbit/s€1420.00
/mes
Configurar

Precios sin IVA donde corresponda. Tráfico: Sin medir, uso justo.

EPYC 9354P host · PCIe 4.0 x16 passthrough · no vGPU time-slicing

00

Treinta y cuatro ciudades, veintinueve países

Las cifras de latencia son medianas medidas desde nuestras propias sondas, no folletos de proveedores. Se mueven; la página se actualiza cuando lo hacen.

01

Passthrough y por qué importa

La mayor parte de la capacidad de GPU barata es una fracción de una tarjeta repartida en una cola. El número de la página del producto es la memoria de la tarjeta, no la tuya, y el rendimiento que mides depende de quién más se despertó esta mañana.

Sin vGPU, sin compartir tiempo, sin planificador entre tú y el silicio.

Aquí la tarjeta está vinculada a tu instancia a nivel de hipervisor mediante un enlace PCIe 4.0 de dieciséis líneas. El dispositivo completo es tuyo: toda la memoria, todas las unidades de cómputo, el ancho de banda completo del motor de copia. Nada se particiona, nada está en cola y ningún otro inquilino aparece en tu lista de dispositivos.

La consecuencia práctica es que tu benchmark de esta noche coincide con tu benchmark del martes pasado. Los trabajos de ajuste fino que duran dos días terminan en el tiempo que predijo tu primera hora. El trabajo interactivo sigue siendo interactivo, porque no hay un trabajo por lotes de otro inquilino delante del tuyo.

01

Toda la VRAM, todo el tiempo

Cuarenta y ocho gigabytes en una L40S, veinte en una RTX 4000 Ada, y nada de ella reservado para una partición de hipervisor. Lo que la tarjeta tiene es lo que tu proceso puede direccionar.

02

El tiempo inactivo no te cuesta extra

La tarjeta es tuya por mes, no por segundo. Deja un modelo residente durante tres semanas entre experimentos y nadie lo reclamará mientras duermes.

03

Dos tarjetas, un host

El nivel de doble tarjeta coloca ambos dispositivos en el mismo dominio NUMA del mismo host. Se comunican a través de PCIe en lugar de un enlace entre tarjetas, lo que conviene saber antes de planificar una topología de entrenamiento en torno a ellas.

04

Tu propia pila

Te entregamos una máquina con una tarjeta dentro y nos mantenemos al margen. Los drivers, el runtime de contenedor, las versiones del framework y el kernel son tuyos. No hay una capa gestionada que tenga opiniones sobre tu Python.

02

Para qué sirven estas tarjetas

Ambas tarjetas son de clase workstation, no la cima de un clúster de entrenamiento, y el posicionamiento honesto se deriva de eso.

Inferencia, fine-tuning, renderizado y trabajo numérico por lotes. En ese orden.

Si tu modelo cabe en cuarenta y ocho gigabytes, un L40S lo servirá competentemente mientras sigas pagando por él. Si no cabe, ningún entusiasmo lo hará caber, y el siguiente paso honesto es la cuantización, el sharding en el nivel de doble tarjeta, o una clase de máquina completamente diferente.

Carga de trabajoQué tarjetaLa restricción real
Servir un modelo cuantizado a usuarios realesRTX 4000 AdaMemoria, luego concurrencia de peticiones
Servir un modelo de tamaño medio a precisión completaL40SCuarenta y ocho gigabytes es el techo que lo decide
Fine-tuning con adaptadoresL40SVRAM durante el pase hacia atrás, no el rendimiento bruto
Fine-tuning completo de un modelo grandeDos L40S, o en otro sitioEl ancho de banda entre tarjetas por PCIe se convierte en el límite
Renderizado por lotes y codificación de vídeoCualquiera de las dosDisco y red, mucho más a menudo que la tarjeta
Simulación numérica en doble precisiónNinguna, generalmenteEstas no son piezas de doble precisión. Toma núcleos EPYC
03

Quiénes no deberían comprar esto

La capacidad de GPU atrae más dimensionamiento optimista que cualquier otro producto que vendemos. Tres grupos de personas deberían pasar de largo.

Lo más útil que podemos decir a algunos clientes es que somos la tienda equivocada.

01

Estás entrenando algo enorme desde cero

El entrenamiento multi-nodo con interconexión de alto ancho de banda entre hosts no es esto. Dos tarjetas por PCIe en un solo host es nuestro techo, y fingir lo contrario desperdiciaría semanas de tu tiempo.

02

Quieres facturación por segundo

Las tarjetas se alquilan por mes. Si tu uso es genuinamente veinte minutos a la semana, una plataforma con medición te costará menos que nosotros, y preferimos decirlo ahora.

03

Tu modelo no cabe

Noventa y seis gigabytes entre dos tarjetas es el máximo direccionable aquí. Haz las cuentas de memoria para pesos, activaciones y estado del optimizador antes de pedir, no después.

04

Necesitas doble precisión

Estas son piezas de precisión simple y precisión mixta. Los códigos científicos que insisten en rendimiento FP64 correrán más rápido en cuarenta y ocho núcleos EPYC que en cualquiera de las tarjetas.

05

Quieres que gestionemos la pila

No mantenemos tu driver, tu versión de CUDA ni tu matriz de frameworks. El add-on de hardening cubre la base del sistema operativo y se detiene ahí.

04

El host alrededor de la tarjeta

Una GPU hambrienta es un calefactor caro. El host importa tanto como la tarjeta, y es donde la mayoría de las ofertas de GPU baratas recortan costes silenciosamente.

EPYC 9354P, memoria ECC, NVMe local a la máquina, puerto de cuarenta gigabits.

01

Núcleos que puedan alimentarla

De ocho a treinta y dos núcleos EPYC dedicados según el nivel, fijados en el mismo dominio NUMA que la tarjeta. La carga de datos y el preprocesamiento son la razón habitual por la que un bucle de entrenamiento se detiene, y son trabajo de CPU.

02

Memoria ECC en el host

DDR5-4800 registrada, de sesenta y cuatro a doscientos cincuenta y seis gigabytes. Un trabajo de cuarenta y ocho horas es exactamente el tipo de cosa que no debería deshacerse por un bit volteado en un búfer del dataloader.

03

NVMe que siga el ritmo

De uno a cuatro terabytes de NVMe local Gen4, en espejo. Los conjuntos de datos se transmiten desde la propia máquina en lugar de a través de un volumen de red que otra persona también está leyendo.

04

Puerto de cuarenta gigabits

Descargar un conjunto de datos de varios terabytes debería llevar una tarde. El uso justo en un puerto de cuarenta gigabits es de doscientos cincuenta terabytes al mes, publicado en la página de precios.

05

Consola fuera de banda

Serial y VNC a través de un túnel autenticado, incluido. Cuando una instalación de driver falla a medianoche, aún puedes acceder a la máquina, que es la única razón por la que existe.

La tarjeta se pasa a través, por lo que el driver se instala dentro de tu instancia como en cualquier otra máquina. Nada en el host toca tu framework, y un reinicio no renegocia nada.

05

Dónde están las tarjetas

Ámsterdam, Fráncfort, Londres, Nueva York, Dallas, Los Ángeles, Singapur y Tokio. Esos son los pisos con la densidad de energía y la refrigeración para ejecutar tarjetas a plena carga de forma continua y no en ráfagas educadas.

Ocho ubicaciones en seis países. Las GPU necesitan energía y refrigeración, no códigos postales.

Fráncfort es el piso de GPU más ocupado que operamos y recibe tarjetas nuevas primero. Dallas es el lugar más fácil para conseguir capacidad con poca antelación, porque la energía allí es barata y el piso es grande. Los Ángeles tiene tarjetas pero a menudo se queda sin stock, así que pide con antelación si la ruta hacia el oeste hacia Asia es lo que buscas.

El stock realmente se mueve en esta línea. Una tarjeta que aparece como disponible al mediodía puede no estar allí por la tarde, y preferimos mostrarte una etiqueta de agotado precisa que aceptar un pedido que no podemos completar esta semana.

SitioNotasUso típico
ÁmsterdamEl sitio más denso de la flota, todo se envía aquí primeroInferencia europea con baja latencia a la mayor parte del continente
FráncfortEl piso de GPU más ocupado, primero en recibir nuevas tarjetasEntrenamiento y ajuste fino donde la capacidad importa más que el último milisegundo
LondresLa latencia transatlántica más baja de EuropaServir a usuarios en ambos lados del Atlántico desde un solo lugar
Nueva YorkAncla de la costa este, gama completa de productosInferencia en América del Norte
DallasEnergía barata, piso grande, capacidad más fácilTrabajos por lotes largos y cualquier cosa sensible al precio
Los ÁngelesLas mejores rutas hacia el oeste que tenemos fuera de AsiaServir al borde del Pacífico desde América del Norte
SingapurOpción predeterminada para el Sudeste AsiáticoInferencia regional
TokioTiempo de ida y vuelta más estable de la regiónTráfico japonés y coreano sensible a la latencia
06

Trabajos largos y cómo no perder uno

Un ajuste fino de cuarenta y ocho horas es una apuesta a que nada salga mal durante dos días. Estructura el trabajo para que perder la apuesta te cueste una hora en lugar del fin de semana.

Checkpoint. Aún lo diremos después de que lo hayas oído cien veces.

  1. 01

    Checkpoint a NVMe local, a menudo

    Cada pocos cientos de pasos, al disco local, porque es lo suficientemente rápido como para que el costo sea insignificante. Un trabajo que no puede reanudarse es un trabajo que eventualmente ejecutarás dos veces.

  2. 02

    Copia los checkpoints fuera de la máquina

    El NVMe local está en espejo, no es inmortal. La copia de seguridad fuera del nodo escribe a una ciudad diferente cada noche, y es el seguro más barato de esta página.

  3. 03

    Snapshot antes de tocar el driver

    Las actualizaciones de driver y framework son la principal causa de que un entorno funcional se convierta en uno que no funciona. Un snapshot tarda segundos en crearse y segundos en restaurarse.

  4. 04

    Controle la temperatura y los relojes, no solo la pérdida

    Las tarjetas se estrangulan cuando la sala tiene un mal día. Si su rendimiento cae sin que su código cambie, mire las cifras de reloj antes de reescribir el cargador de datos.

  5. 05

    Pregunte antes de escalar horizontalmente

    Si el siguiente paso son cuatro u ocho tarjetas, diga al soporte qué está intentando hacer. A veces la respuesta es una máquina de metal desnudo, y ocasionalmente la respuesta es que no somos el proveedor adecuado.

07

Cuando falla el hardware

Las GPU generalmente se degradan antes de morir: relojes cayendo, errores de memoria corregidos en la tarjeta, un trabajo que de repente va un tercio más lento por ninguna razón que pueda encontrar en su código.

Las tarjetas fallan de forma distinta a los discos. Más lento, y con más aviso.

Nuestra monitorización vigila la temperatura de la tarjeta, el comportamiento del reloj y los contadores de errores en cada host. Cuando una tarjeta empieza a comportarse mal, le contactamos antes de que deje de funcionar, y programamos el cambio alrededor de su trabajo, no a mitad de él. Si la tarjeta falla por completo, su instancia se reconstruye en otro host del mismo sitio conservando sus volúmenes y direcciones.

La recuperación en esta línea es más lenta que en el resto de la flota, y vale la pena ser claro sobre el porqué: un terabyte de conjunto de datos y un modelo residente tardan minutos reales en moverse y recargarse. Planifique para una hora en lugar de quince minutos, y mantenga los puntos de control en algún lugar distinto a la máquina que está ardiendo.

01

Advertencia antes del fallo, cuando sea posible

Los contadores de errores y la telemetría de reloj se leen continuamente. La mayoría de los reemplazos de tarjetas ocurren en una ventana que acordamos con el cliente de antemano.

02

Los volúmenes y las direcciones sobreviven

La reconstrucción conserva el contenido de su NVMe y sus direcciones IP. Nada en su DNS ni en sus certificados necesita cambiar.

03

Los créditos son automáticos

El mismo tiempo de actividad contractual de 99,99% se aplica aquí como en cualquier otro lugar, y el crédito llega sin formulario de reclamación.

08

Preguntas sobre esta línea

El dispositivo físico está vinculado a su instancia a través de un enlace completo de dieciséis líneas. No hay particionado vGPU, ni segmentación de tiempo, ni otro inquilino en ella. Su lista de dispositivos muestra una tarjeta porque hay una tarjeta.

No. Las tarjetas son mensuales, y el compromiso más corto es de un mes. Si su carga de trabajo es genuinamente irregular, un proveedor con medición será más barato, y no hay versión de esta conversación en la que finjamos lo contrario.

Ninguno, a menos que lo pida. Las imágenes se envían limpias y el controlador se instala dentro de su instancia, porque la mitad de nuestros clientes de GPU tienen opiniones firmes sobre las versiones y la otra mitad tiene un contenedor que lleva el suyo propio.

No. Están en el mismo host y el mismo dominio NUMA, y se comunican a través de PCIe. Para trabajo de paralelismo de datos con intercambio de gradientes modesto, esto está bien. Para cualquier cosa que asuma un tejido de tarjeta a tarjeta de alto ancho de banda, no lo está, y debe ajustar sus expectativas en consecuencia.

No. La pasarela requiere que el host esté construido para ello, con la topología PCIe y el presupuesto de energía en su lugar. Mudarse a esta línea significa una nueva instancia y una copia de datos.

El volumen se borra y la tarjeta vuelve al grupo. Sáquese sus puntos de control antes de que termine el plazo, porque una instancia cancelada está genuinamente eliminada, no estacionada en algún lugar esperando a que cambie de opinión.

Listo cuando tú lo estés

Tome una tarjeta completa

Revise primero la aritmética de memoria, elija el sitio con capacidad, y pague en moneda. El acceso root llega en menos de un minuto, la decisión del controlador sigue siendo suya, y los primeros siete días son reembolsables sin razón.