Una tarjeta, no una porción de una
Una GPU compartida es que el trabajo de otra persona termine antes de que comience el tuyo. Cada tarjeta de esta línea se pasa a una instancia a través de un enlace completo de dieciséis líneas y permanece allí hasta que canceles, esté inactiva o no.
A shared GPU is someone else’s job finishing before yours starts. Every card in this line is passed straight through to a single instance and stays there until you cancel.
| Plan | Núcleos dedicados | Memoria | Almacenamiento NVMe | Gráficos | Velocidad de puerto | Precio | |
|---|---|---|---|---|---|---|---|
| G-ADA Inference and light training | 8 | 64 GB | 1 TB | 1 × RTX 4000 Ada · 20 GB | 40 Gbit/s | €239.00 /mes | Configurar |
| G-L40SLa mayoría contratado 48 GB of VRAM, undivided | 16 | 128 GB | 2 TB | 1 × L40S · 48 GB | 40 Gbit/s | €749.00 /mes | Configurar |
| G-L40S×2 Two cards, one NUMA node | 32 | 256 GB | 4 TB | 2 × L40S · 96 GB | 40 Gbit/s | €1420.00 /mes | Configurar |
Precios sin IVA donde corresponda. Tráfico: Sin medir, uso justo.
EPYC 9354P host · PCIe 4.0 x16 passthrough · no vGPU time-slicing
Treinta y cuatro ciudades, veintinueve países
Las cifras de latencia son medianas medidas desde nuestras propias sondas, no folletos de proveedores. Se mueven; la página se actualiza cuando lo hacen.
Passthrough y por qué importa
La mayor parte de la capacidad de GPU barata es una fracción de una tarjeta repartida en una cola. El número de la página del producto es la memoria de la tarjeta, no la tuya, y el rendimiento que mides depende de quién más se despertó esta mañana.
Sin vGPU, sin compartir tiempo, sin planificador entre tú y el silicio.
Aquí la tarjeta está vinculada a tu instancia a nivel de hipervisor mediante un enlace PCIe 4.0 de dieciséis líneas. El dispositivo completo es tuyo: toda la memoria, todas las unidades de cómputo, el ancho de banda completo del motor de copia. Nada se particiona, nada está en cola y ningún otro inquilino aparece en tu lista de dispositivos.
La consecuencia práctica es que tu benchmark de esta noche coincide con tu benchmark del martes pasado. Los trabajos de ajuste fino que duran dos días terminan en el tiempo que predijo tu primera hora. El trabajo interactivo sigue siendo interactivo, porque no hay un trabajo por lotes de otro inquilino delante del tuyo.
Toda la VRAM, todo el tiempo
Cuarenta y ocho gigabytes en una L40S, veinte en una RTX 4000 Ada, y nada de ella reservado para una partición de hipervisor. Lo que la tarjeta tiene es lo que tu proceso puede direccionar.
El tiempo inactivo no te cuesta extra
La tarjeta es tuya por mes, no por segundo. Deja un modelo residente durante tres semanas entre experimentos y nadie lo reclamará mientras duermes.
Dos tarjetas, un host
El nivel de doble tarjeta coloca ambos dispositivos en el mismo dominio NUMA del mismo host. Se comunican a través de PCIe en lugar de un enlace entre tarjetas, lo que conviene saber antes de planificar una topología de entrenamiento en torno a ellas.
Tu propia pila
Te entregamos una máquina con una tarjeta dentro y nos mantenemos al margen. Los drivers, el runtime de contenedor, las versiones del framework y el kernel son tuyos. No hay una capa gestionada que tenga opiniones sobre tu Python.
Para qué sirven estas tarjetas
Ambas tarjetas son de clase workstation, no la cima de un clúster de entrenamiento, y el posicionamiento honesto se deriva de eso.
Inferencia, fine-tuning, renderizado y trabajo numérico por lotes. En ese orden.
Si tu modelo cabe en cuarenta y ocho gigabytes, un L40S lo servirá competentemente mientras sigas pagando por él. Si no cabe, ningún entusiasmo lo hará caber, y el siguiente paso honesto es la cuantización, el sharding en el nivel de doble tarjeta, o una clase de máquina completamente diferente.
| Carga de trabajo | Qué tarjeta | La restricción real |
|---|---|---|
| Servir un modelo cuantizado a usuarios reales | RTX 4000 Ada | Memoria, luego concurrencia de peticiones |
| Servir un modelo de tamaño medio a precisión completa | L40S | Cuarenta y ocho gigabytes es el techo que lo decide |
| Fine-tuning con adaptadores | L40S | VRAM durante el pase hacia atrás, no el rendimiento bruto |
| Fine-tuning completo de un modelo grande | Dos L40S, o en otro sitio | El ancho de banda entre tarjetas por PCIe se convierte en el límite |
| Renderizado por lotes y codificación de vídeo | Cualquiera de las dos | Disco y red, mucho más a menudo que la tarjeta |
| Simulación numérica en doble precisión | Ninguna, generalmente | Estas no son piezas de doble precisión. Toma núcleos EPYC |
Quiénes no deberían comprar esto
La capacidad de GPU atrae más dimensionamiento optimista que cualquier otro producto que vendemos. Tres grupos de personas deberían pasar de largo.
Lo más útil que podemos decir a algunos clientes es que somos la tienda equivocada.
Estás entrenando algo enorme desde cero
El entrenamiento multi-nodo con interconexión de alto ancho de banda entre hosts no es esto. Dos tarjetas por PCIe en un solo host es nuestro techo, y fingir lo contrario desperdiciaría semanas de tu tiempo.
Quieres facturación por segundo
Las tarjetas se alquilan por mes. Si tu uso es genuinamente veinte minutos a la semana, una plataforma con medición te costará menos que nosotros, y preferimos decirlo ahora.
Tu modelo no cabe
Noventa y seis gigabytes entre dos tarjetas es el máximo direccionable aquí. Haz las cuentas de memoria para pesos, activaciones y estado del optimizador antes de pedir, no después.
Necesitas doble precisión
Estas son piezas de precisión simple y precisión mixta. Los códigos científicos que insisten en rendimiento FP64 correrán más rápido en cuarenta y ocho núcleos EPYC que en cualquiera de las tarjetas.
Quieres que gestionemos la pila
No mantenemos tu driver, tu versión de CUDA ni tu matriz de frameworks. El add-on de hardening cubre la base del sistema operativo y se detiene ahí.
El host alrededor de la tarjeta
Una GPU hambrienta es un calefactor caro. El host importa tanto como la tarjeta, y es donde la mayoría de las ofertas de GPU baratas recortan costes silenciosamente.
EPYC 9354P, memoria ECC, NVMe local a la máquina, puerto de cuarenta gigabits.
Núcleos que puedan alimentarla
De ocho a treinta y dos núcleos EPYC dedicados según el nivel, fijados en el mismo dominio NUMA que la tarjeta. La carga de datos y el preprocesamiento son la razón habitual por la que un bucle de entrenamiento se detiene, y son trabajo de CPU.
Memoria ECC en el host
DDR5-4800 registrada, de sesenta y cuatro a doscientos cincuenta y seis gigabytes. Un trabajo de cuarenta y ocho horas es exactamente el tipo de cosa que no debería deshacerse por un bit volteado en un búfer del dataloader.
NVMe que siga el ritmo
De uno a cuatro terabytes de NVMe local Gen4, en espejo. Los conjuntos de datos se transmiten desde la propia máquina en lugar de a través de un volumen de red que otra persona también está leyendo.
Puerto de cuarenta gigabits
Descargar un conjunto de datos de varios terabytes debería llevar una tarde. El uso justo en un puerto de cuarenta gigabits es de doscientos cincuenta terabytes al mes, publicado en la página de precios.
Consola fuera de banda
Serial y VNC a través de un túnel autenticado, incluido. Cuando una instalación de driver falla a medianoche, aún puedes acceder a la máquina, que es la única razón por la que existe.
La tarjeta se pasa a través, por lo que el driver se instala dentro de tu instancia como en cualquier otra máquina. Nada en el host toca tu framework, y un reinicio no renegocia nada.
Dónde están las tarjetas
Ámsterdam, Fráncfort, Londres, Nueva York, Dallas, Los Ángeles, Singapur y Tokio. Esos son los pisos con la densidad de energía y la refrigeración para ejecutar tarjetas a plena carga de forma continua y no en ráfagas educadas.
Ocho ubicaciones en seis países. Las GPU necesitan energía y refrigeración, no códigos postales.
Fráncfort es el piso de GPU más ocupado que operamos y recibe tarjetas nuevas primero. Dallas es el lugar más fácil para conseguir capacidad con poca antelación, porque la energía allí es barata y el piso es grande. Los Ángeles tiene tarjetas pero a menudo se queda sin stock, así que pide con antelación si la ruta hacia el oeste hacia Asia es lo que buscas.
El stock realmente se mueve en esta línea. Una tarjeta que aparece como disponible al mediodía puede no estar allí por la tarde, y preferimos mostrarte una etiqueta de agotado precisa que aceptar un pedido que no podemos completar esta semana.
| Sitio | Notas | Uso típico |
|---|---|---|
| Ámsterdam | El sitio más denso de la flota, todo se envía aquí primero | Inferencia europea con baja latencia a la mayor parte del continente |
| Fráncfort | El piso de GPU más ocupado, primero en recibir nuevas tarjetas | Entrenamiento y ajuste fino donde la capacidad importa más que el último milisegundo |
| Londres | La latencia transatlántica más baja de Europa | Servir a usuarios en ambos lados del Atlántico desde un solo lugar |
| Nueva York | Ancla de la costa este, gama completa de productos | Inferencia en América del Norte |
| Dallas | Energía barata, piso grande, capacidad más fácil | Trabajos por lotes largos y cualquier cosa sensible al precio |
| Los Ángeles | Las mejores rutas hacia el oeste que tenemos fuera de Asia | Servir al borde del Pacífico desde América del Norte |
| Singapur | Opción predeterminada para el Sudeste Asiático | Inferencia regional |
| Tokio | Tiempo de ida y vuelta más estable de la región | Tráfico japonés y coreano sensible a la latencia |
Trabajos largos y cómo no perder uno
Un ajuste fino de cuarenta y ocho horas es una apuesta a que nada salga mal durante dos días. Estructura el trabajo para que perder la apuesta te cueste una hora en lugar del fin de semana.
Checkpoint. Aún lo diremos después de que lo hayas oído cien veces.
- 01
Checkpoint a NVMe local, a menudo
Cada pocos cientos de pasos, al disco local, porque es lo suficientemente rápido como para que el costo sea insignificante. Un trabajo que no puede reanudarse es un trabajo que eventualmente ejecutarás dos veces.
- 02
Copia los checkpoints fuera de la máquina
El NVMe local está en espejo, no es inmortal. La copia de seguridad fuera del nodo escribe a una ciudad diferente cada noche, y es el seguro más barato de esta página.
- 03
Snapshot antes de tocar el driver
Las actualizaciones de driver y framework son la principal causa de que un entorno funcional se convierta en uno que no funciona. Un snapshot tarda segundos en crearse y segundos en restaurarse.
- 04
Controle la temperatura y los relojes, no solo la pérdida
Las tarjetas se estrangulan cuando la sala tiene un mal día. Si su rendimiento cae sin que su código cambie, mire las cifras de reloj antes de reescribir el cargador de datos.
- 05
Pregunte antes de escalar horizontalmente
Si el siguiente paso son cuatro u ocho tarjetas, diga al soporte qué está intentando hacer. A veces la respuesta es una máquina de metal desnudo, y ocasionalmente la respuesta es que no somos el proveedor adecuado.
Cuando falla el hardware
Las GPU generalmente se degradan antes de morir: relojes cayendo, errores de memoria corregidos en la tarjeta, un trabajo que de repente va un tercio más lento por ninguna razón que pueda encontrar en su código.
Las tarjetas fallan de forma distinta a los discos. Más lento, y con más aviso.
Nuestra monitorización vigila la temperatura de la tarjeta, el comportamiento del reloj y los contadores de errores en cada host. Cuando una tarjeta empieza a comportarse mal, le contactamos antes de que deje de funcionar, y programamos el cambio alrededor de su trabajo, no a mitad de él. Si la tarjeta falla por completo, su instancia se reconstruye en otro host del mismo sitio conservando sus volúmenes y direcciones.
La recuperación en esta línea es más lenta que en el resto de la flota, y vale la pena ser claro sobre el porqué: un terabyte de conjunto de datos y un modelo residente tardan minutos reales en moverse y recargarse. Planifique para una hora en lugar de quince minutos, y mantenga los puntos de control en algún lugar distinto a la máquina que está ardiendo.
Advertencia antes del fallo, cuando sea posible
Los contadores de errores y la telemetría de reloj se leen continuamente. La mayoría de los reemplazos de tarjetas ocurren en una ventana que acordamos con el cliente de antemano.
Los volúmenes y las direcciones sobreviven
La reconstrucción conserva el contenido de su NVMe y sus direcciones IP. Nada en su DNS ni en sus certificados necesita cambiar.
Los créditos son automáticos
El mismo tiempo de actividad contractual de 99,99% se aplica aquí como en cualquier otro lugar, y el crédito llega sin formulario de reclamación.
Preguntas sobre esta línea
El dispositivo físico está vinculado a su instancia a través de un enlace completo de dieciséis líneas. No hay particionado vGPU, ni segmentación de tiempo, ni otro inquilino en ella. Su lista de dispositivos muestra una tarjeta porque hay una tarjeta.
No. Las tarjetas son mensuales, y el compromiso más corto es de un mes. Si su carga de trabajo es genuinamente irregular, un proveedor con medición será más barato, y no hay versión de esta conversación en la que finjamos lo contrario.
Ninguno, a menos que lo pida. Las imágenes se envían limpias y el controlador se instala dentro de su instancia, porque la mitad de nuestros clientes de GPU tienen opiniones firmes sobre las versiones y la otra mitad tiene un contenedor que lleva el suyo propio.
No. Están en el mismo host y el mismo dominio NUMA, y se comunican a través de PCIe. Para trabajo de paralelismo de datos con intercambio de gradientes modesto, esto está bien. Para cualquier cosa que asuma un tejido de tarjeta a tarjeta de alto ancho de banda, no lo está, y debe ajustar sus expectativas en consecuencia.
No. La pasarela requiere que el host esté construido para ello, con la topología PCIe y el presupuesto de energía en su lugar. Mudarse a esta línea significa una nueva instancia y una copia de datos.
El volumen se borra y la tarjeta vuelve al grupo. Sáquese sus puntos de control antes de que termine el plazo, porque una instancia cancelada está genuinamente eliminada, no estacionada en algún lugar esperando a que cambie de opinión.
Tome una tarjeta completa
Revise primero la aritmética de memoria, elija el sitio con capacidad, y pague en moneda. El acceso root llega en menos de un minuto, la decisión del controlador sigue siendo suya, y los primeros siete días son reembolsables sin razón.