Mantenido desde octubre de 2019

Passthrough, no time-slicing

Cada GPU que vendemos es una tarjeta física completa vinculada a una instancia. El time-slicing nos habría permitido vender cada tarjeta cuatro veces, y lo costeamos adecuadamente.

Las instancias de GPU se lanzaron este mes en Fráncfort, Dallas y Singapur. Dos configuraciones para empezar: una RTX 4000 Ada con veinte gigabytes de VRAM, y una L40S con cuarenta y ocho. Ambas se alojan en un host EPYC 9354P, conectadas por PCIe 4.0 a dieciséis líneas completas, pasadas directamente a una sola instancia.

Pasadas directamente significa que la tarjeta está vinculada a tu instancia por el hipervisor al arrancar y permanece ahí hasta que cancelas. Sin programador, sin cola, sin otro inquilino, sin partición de VRAM que otro también esté usando.

La decisión que realmente tomamos

Dividir una tarjeta en tiempo entre inquilinos es una forma compatible, bien documentada y completamente legítima de llevar este negocio. Pasamos unas tres semanas calculando sus costes, porque la aritmética es atractiva: una sola tarjeta de cuarenta y ocho gigabytes se puede presentar como cuatro instancias de doce gigabytes, lo que significa cuatro alquileres de una compra y cuatro clientes de un presupuesto de energía.

Luego medimos las latencias de cola.

Una tarjeta compartida funciona bien cuando los otros inquilinos están inactivos y se vuelve desagradable en cuanto no lo están. La latencia de inferencia en una tarjeta con tres inquilinos activos fue aproximadamente la esperada en la mediana y de cuatro a nueve veces peor en el percentil noventa y nueve, dependiendo de lo que los demás estuvieran haciendo. Los trabajos de entrenamiento lo pasaron peor, porque un trabajo de entrenamiento no es ráfaga y por tanto nunca obtiene los huecos.

También está el problema de la licencia. El software de virtualización que hace posible la partición limpia conlleva una licencia anual por tarjeta, y ese coste no se evapora; aterriza en la factura del que alquila el segmento. Habríamos estado cobrándote por el privilegio de compartir.

Cómo está construido el host

ElementoQué es
CPU del hostEPYC 9354P, treinta y dos núcleos, ECC DDR5-4800
ConexiónPCIe 4.0, dieciséis líneas, un grupo IOMMU por tarjeta
Fijación de vCPUFijada al zócalo y al nodo NUMA del que cuelga la tarjeta
MemoriaAsignada del mismo nodo NUMA, nunca intercalada
Tarjetas por nodoCuatro como máximo, dos en la mayoría de los sitios, limitado por la energía del rack
Puerto40 Gbit/s, porque un modelo que no cabe en VRAM tiene que venir de alguna parte

La fijación NUMA importa más de lo que sugiere la hoja de especificaciones. Una vCPU en el zócalo equivocado alimentando a una tarjeta a través de la interconexión pierde rendimiento real en todo lo que transmite datos, y es la configuración errónea más común que vemos en hosts GPU de otros sitios.

Energía, y por qué solo hay tres sitios

Una tarjeta de trescientos cincuenta vatios cambia la aritmética de un rack. Los sitios que albergan cómodamente doce nodos de propósito general albergan cuatro nodos GPU y luego se quedan sin refrigeración. Fráncfort, Dallas y Singapur fueron elegidos porque los tres tenían margen de energía y un plano de planta que podía soportar la densidad sin que tuviéramos que renegociar nada.

Más sitios seguirán según lo permita la energía, y la restricción honesta es siempre la electricidad, no la demanda. Cuando un sitio no puede soportar el consumo, preferimos no vender el producto antes que venderlo con limitación térmica.

Lo que no puedes hacer

  • Sin emparejamiento de tarjetas entre nodos. Una instancia de dos tarjetas existe y ambas están en un solo nodo NUMA. Cualquier cosa más grande es una conversación sobre metal desnudo.
  • Sin partición dentro de tu instancia. Tienes la tarjeta entera, y cómo la divides es cosa tuya y de tu framework.
  • Sin intercambio en caliente. Cambiar de GPU significa una reconstrucción, porque la tarjeta está vinculada al arranque.
  • Sin tarjetas de consumo para juegos. Preguntado semanalmente. Les falta el perfil de refrigeración para un rack y, en la mayoría de los casos, la licencia para ser alquiladas en absoluto.

Precios, claramente

Las tarjetas cuestan lo que cuestan y el margen sobre ellas es más fino que en el resto del catálogo. No hay facturación por horas, porque la facturación por horas en hardware dedicado significa mantener tarjetas inactivas y cobrar a todos los demás por el privilegio. Mensual, con el reembolso de siete días estándar, y el mismo pago solo con criptomonedas como todo lo demás.

Si tu carga de trabajo es realmente de ráfagas y por horas, nosotros somos el proveedor equivocado y un gran hiperescalador es el adecuado. Eso será cierto mientras nos neguemos a dividir el tiempo, que es indefinidamente.

Listo cuando tú lo estés

Elige una ciudad. Elige un tamaño. Paga con monedas.

Sin fórmulas sobre quién eres, sin esperar a que un humano te apruebe, sin llamada telefónica para verificar nada. La factura se liquida y las credenciales llegan a tu bandeja de entrada.