Lo que realmente hay en el rack
Dos generaciones de CPU, ninguna tercera. Memoria que corrige sus propios errores en la línea donde eso importa, NVMe empresarial en pares en espejo con un repuesto inactivo a su lado, y tres días de quemado antes de que un nodo pueda conocer a un cliente.
Dos generaciones, y nada más antiguo
La mayoría de los hosts ejecutan tres o cuatro generaciones a la vez y las venden al mismo precio, por lo que dos servidores con especificaciones idénticas pueden diferir en un cuarenta por ciento en la misma carga de trabajo. Nosotros mantenemos la flota reducida.
Nada en producción es más de una generación más antiguo que el tope actual. Esa norma se cumple desde 2022.
Ryzen 9 9950X, Zen 5
16 núcleos, 32 hilos, con impulso hasta 5.7 GHz. Es el hilo único más rápido que podemos comprar, y la velocidad de hilo único sigue decidiendo la rapidez con que termina una petición en la mayoría de aplicaciones reales.
EPYC 9354P, Zen 4
32 núcleos y 64 hilos en un solo zócalo, doce canales de memoria, ECC registrado. Donde el recuento de núcleos, la capacidad de memoria y el comportamiento NUMA predecible importan más que el reloj máximo, esta es la parte que gana.
Un solo zócalo siempre que sea posible
El acceso a memoria entre zócalos es un precipicio de latencia que no puedes ajustar hasta salir de él. Solo la configuración de metal desnudo más grande es de doble zócalo, y es de doble zócalo porque el cliente pidió explícitamente 64 núcleos.
Los núcleos se asignan una sola vez
Un núcleo vendido a ti se programa para ti. Sin créditos de ráfaga, sin ratio de sobresuscripción, sin tiempo de robo que aparezca bajo carga y desaparezca antes de que puedas capturarlo.
Por qué no los chips de servidor más nuevos
Las partes de servidor Zen 5 están en el laboratorio y no en la flota. Cuando sustituyan al 9354P aparecerá en el registro de cambios con fechas de migración, y no como una frase en la portada seis meses antes de que nadie pueda comprar uno.
Memoria, y dónde vive realmente el ECC
Los errores de memoria no son raros; solo son invisibles hasta que algo importante se vuelve sutilmente incorrecto. En la línea de servidores, cada uno se corrige y se registra.
Los nodos EPYC llevan doce módulos DDR5-4800 ECC registrados, uno por canal, todos poblados. Poblar cada canal no es cuestión de capacidad, sino de ancho de banda: un bus de memoria medio lleno en una pieza de 32 núcleos es un cuello de botella que notarás en cualquier cosa que toque RAM con prisa.
Los nodos Ryzen ejecutan DDR5-5600 sin ECC, porque la plataforma de consumo no lo ofrece en una forma en la que confiaríamos. Eso se declara claramente aquí en lugar de enterrado: si tu carga de trabajo necesita corrección de errores, la línea EPYC comienza en ochenta y nueve euros y existe exactamente para eso.
Los errores corregibles se cuentan
Un rango que produzca más de un puñado de correcciones al día se marca, y el módulo se cambia en la siguiente ventana de mantenimiento, ocurra o no algo mal.
Los errores incorregibles drenan el nodo
Las instancias migran fuera, el nodo sale del grupo y el DIMM se reemplaza antes de que regrese. Puedes ver una migración en vivo; no deberías ver un bloqueo.
Sin globo, sin fusión de páginas
La memoria se asigna una vez y no se cuenta dos veces. La fusión de mismas páginas está desactivada en toda la flota, porque es un canal lateral entre inquilinos y una afirmación de rendimiento que se evapora bajo carga real.
La capacidad por nodo es generosa a propósito
Un nodo EPYC se envía con suficiente memoria para que el plan más grande que aloja aún deje margen. Los nodos llenos hasta el último gigabyte no tienen dónde colocar una migración cuando un vecino tiene que moverse.
NVMe, durabilidad y el repuesto que no hace nada
Cada unidad es una pieza empresarial Gen4 con protección contra pérdida de energía, que es un banco de condensadores que termina de escribir lo que reconoció cuando la energía se apaga a mitad del vaciado.
Un repuesto activo por nodo, inactivo, esperando. Es el seguro más barato del edificio.
Pares en espejo, siempre
Las lecturas se distribuyen en ambas mitades; las escrituras se reconocen desde la caché protegida y se guardan en ambas. Una sola unidad fallida cambia ligeramente el perfil de rendimiento, y tu disponibilidad no cambia en absoluto.
Un repuesto activo por nodo
Un disco por nodo permanece inactivo y vacío. Cuando un espejo pierde una mitad, la copia de repuesto toma el control automáticamente y la reconstrucción comienza antes de que nadie haya leído la alerta.
Margen de resistencia, no límites de resistencia
Los nodos generales usan unidades de clase 1 DWPD; los nodos de almacenamiento usan 3 DWPD para el nivel de escritura. Las unidades se reemplazan al ochenta por ciento de la resistencia nominal en lugar de llegar al número de la hoja de datos.
Nada de discos de consumo en ningún sitio
Ni en el nivel de caché, ni en el nivel de almacenamiento masivo, ni en un nodo que alguien montó rápidamente en 2021 y olvidó. El NVMe de consumo es rápido durante once segundos y luego ya no lo es, lo cual es un buen intercambio en un portátil.
La capacidad se asigna, no se promete
El almacenamiento no se aprovisiona de forma fina entre inquilinos. Si el plan dice 800 GB, 800 GB existen en ese nodo con su nombre, y nadie más puede crecer hacia ellos.
Qué hay en cada clase de nodo
Cinco clases de nodo soportan las cinco líneas de producto. El almacenamiento masivo en la clase S es SATA empresarial detrás de un nivel de escritura NVMe, que es el único medio giratorio en toda la flota.
| Clase | CPU | Memoria | NVMe | Red | Alimentación |
|---|---|---|---|---|---|
| R — Ryzen NVMe | Ryzen 9 9950X, 16C/32T | 128 GB DDR5-5600 | 2 × 3,84 TB en espejo, 1 de repuesto | 2 × 10 GbE, LACP | 2 × 800 W, A y B |
| E — EPYC High-Memory | EPYC 9354P, 32C/64T | 12 × DDR5-4800 ECC RDIMM | 4 × 3,84 TB en espejo, 1 de repuesto | 2 × 25 GbE, LACP | 2 × 1200 W, A y B |
| G — GPU | EPYC 9354P, 32C/64T | 256 GB ECC DDR5-4800 | 4 × 3,84 TB en espejo, 1 de repuesto | 2 × 40 GbE, LACP | 2 × 2000 W, A y B |
| S — Storage | EPYC 9354P, 32C/64T | 128 GB ECC DDR5-4800 | 2 × 3,84 TB de nivel de escritura, SATA masivo detrás | 2 × 25 GbE, LACP | 2 × 1200 W, A y B |
| BM — Bare Metal | Ryzen 9950X, o uno o dos EPYC 9354P | 128 GB a 1 TB | Hasta 8 × 7,68 TB | 10 a 40 GbE | 2 × 1200 W, A y B |
Los nodos GPU pasan tarjetas físicas completas a través de PCIe 4.0 x16 sin división de tiempo, por lo que la cifra de alimentación es la que es. Dos tarjetas en una misma instancia se sitúan en el mismo nodo NUMA, porque dividirlas entre sockets costaría más de lo que gana la segunda tarjeta.
Alimentación redundante y gestión que no está en internet
Dos de todo lo que se puede duplicar, y una red de gestión que nunca ha tenido ruta al mundo exterior.
Alimentación A y B, rutas separadas
Dos fuentes por nodo en distribución independiente, cada una dimensionada para soportar toda la máquina por sí sola. Perder una alimentación es un evento registrado y nada más, y lo demostramos en cada nodo durante el quemado.
Batería, luego generador
La batería cubre la transferencia; los generadores cubren el resto. La transferencia se prueba según un programa en cada sitio, y un sitio que falla una prueba no recibe nodos nuevos hasta que pasa una.
Sin número de nivel citado
Las clasificaciones pertenecen a los edificios y a los operadores que las encargaron, no a un inquilino que repite un número en un folleto de marketing. Lo que le diremos, por sitio, es la topología de alimentación y el último resultado de la prueba de transferencia.
Fuera de banda en su propia VLAN
Las interfaces de gestión no tienen ruta pública y nunca la han tenido. El acceso pasa por un túnel autenticado, se registra y está disponible tanto para usted como para nosotros.
Consola incluida, sin coste
Serial y VNC a su instancia a través de ese túnel. Funciona cuando su configuración de red no lo hace, que es el único momento en que alguien la quiere.
IPMI en metal, credenciales por término
Los clientes de metal desnudo obtienen IPMI a través de una VPN con control de energía, orden de arranque y medios virtuales. Las credenciales se rotan al final de un término y el firmware del controlador se actualiza según nuestro calendario, no el suyo.
Burn-in: tres días antes de que conozca a un cliente
Aproximadamente uno de cada nueve nodos falla algo en la primera pasada. Casi siempre es un solo DIMM.
- 01
Firmware a una línea base conocida
El firmware del sistema, del controlador, de red y de las unidades se fija a las versiones que ejecuta la flota antes de que se permita comenzar cualquier prueba. Un nodo probado con el firmware equivocado no ha probado nada útil.
- 02
Memoria, en profundidad
Múltiples pasadas completas en cada módulo poblado, horas en lugar de minutos. Esta etapa detecta la mayor parte de lo que detecta el burn-in, y es la razón por la que el calendario se mide en días.
- 03
Soak térmico
Todos los núcleos a plena carga durante seis horas con la entrada en el extremo cálido de su rango. Observamos la degradación de los relojes boost sostenidos, no solo la temperatura, porque un nodo que se estrangula térmicamente en la hora cinco le haría lo mismo a usted en el mes tres.
- 04
Verificación de almacenamiento de superficie completa
Cada unidad se escribe de extremo a extremo, se lee y se compara. Los contadores SMART al final de esta etapa se convierten en la línea base contra la que se juzga la unidad durante el resto de su vida.
- 05
Velocidad de línea, en ambas direcciones a la vez
Cada puerto se lleva a plena capacidad en ambas direcciones durante una hora, comprobando los contadores del lado del conmutador para detectar errores que el host jamás notaría.
- 06
Corte un enlace, luego el otro
Se retira una alimentación, se restaura, y luego lo mismo en el otro lado. Cualquier nodo que siquiera parpadee no entra en servicio.
- 07
Un día tranquilo en la flota
Veinticuatro horas en monitoreo sin ejecutar ninguna instancia en absoluto. Luego comienza a aceptar clientes.
El tiempo total transcurrido es de unas 72 horas. También es la razón por la que el stock en un sitio nuevo aparece en lotes en lugar de llegar de a poco: llega un rack y tres días después todo está disponible a la vez.
Cuando una unidad comienza a fallar
Las unidades no suelen morir de repente. Lo anuncian durante días en contadores que nadie lee, por eso los nuestros se leen cada cinco minutos.
- 01
Umbrales, no elegías
Errores de medios, sectores reasignados, nivel de desgaste y valores atípicos de latencia se muestrean continuamente. Una unidad que cruza cualquier umbral se marca para reemplazo mientras aún funciona perfectamente.
- 02
El repuesto asume primero
El repuesto en caliente se incorpora al espejo antes de retirar la unidad marcada, para que el par nunca corra como una sola copia mientras alguien espera a un técnico.
- 03
Reconstrucción, limitada a propósito
Un espejo de 3.84 TB podría reconstruirse en unos cuarenta minutos a plena velocidad. Lo ejecutamos más lento, en aproximadamente dos horas, porque reconstruir a plena velocidad es indistinguible de un incidente de rendimiento para las instancias de ese nodo.
- 04
Se le informa, y nada más cambia
Aparece una nota en la página de la instancia. Sin reinicio, sin migración, sin ventana de mantenimiento y sin ticket que tenga que responder.
- 05
El disco sale hecho pedazos
Los discos fallidos y retirados se destruyen en el lugar en lugar de devolverse para obtener crédito por garantía. El crédito vale menos que la certeza.
Un mirror es redundancia, no una copia de seguridad. Te protege de un disco, no de una migración defectuosa o de un borrado entusiasta. Las instantáneas cuestan cinco euros por cinco ranuras y la copia de seguridad fuera del nodo nueve euros por 500 GB, escrita en un sitio distinto al de la instancia.
Preguntas sobre hardware
No. Los nodos Ryzen usan DDR5-5600 sin ECC, y preferimos decirlo aquí antes de que lo descubras en una hoja de datos más tarde. Cualquier cosa donde la corrupción silenciosa de memoria sea inaceptable pertenece a EPYC.
Sí, y es comprobable. Ejecuta un benchmark de un solo núcleo sostenido a las tres de la madrugada y de nuevo en hora punta; los números no deberían moverse. Si lo hacen, abre un ticket, porque algo está mal y nos gustaría saberlo.
No por nombre, pero puedes pedir anti-afinidad: dos de tus instancias colocadas en nodos separados, conmutadores separados y alimentaciones separadas. No cuesta nada y solo requiere un ticket.
Cuando el trabajo lo permite, las instancias se migran en vivo y ves unos pocos cientos de milisegundos de pausa. De lo contrario, tienes al menos cinco días de aviso, con una ventana que puedes mover una vez si el momento no te viene bien.
No. Los núcleos, la memoria y el NVMe se asignan una vez cada uno. El único recurso compartido es el uplink, por eso la cifra de uso justo se publica en lugar de insinuarse.
Cada nodo en producción ejecuta Zen 4 o Zen 5. La última de la generación anterior salió de la flota en 2022, y desde entonces no se ha vendido nada con silicio más antiguo.
Mismo hardware, treinta y cuatro ciudades
La especificación del nodo no cambia con la bandera del edificio. Elige la jurisdicción y la latencia que quieras, y luego elige el tamaño.