Qué está roto, y desde cuándo
La página de estado se alimenta de las mismas sondas que despiertan al ingeniero de guardia. No hay ningún paso editorial entre una comprobación fallida y un panel rojo, lo cual es deliberado y ocasionalmente embarazoso.
90 días · Las cifras de latencia son medianas medidas desde nuestras propias sondas, no folletos de proveedores. Se mueven; la página se actualiza cuando lo hacen.
Diario
Un diario de ingeniería. Los incidentes reciben un análisis post-mortem con marcas de tiempo reales, las decisiones de hardware reciben los números que las motivaron, y los cambios de política reciben el razonamiento incluso cuando el razonamiento nos hace parecer lentos. Nada de esto fue escrito por un departamento de marketing, lo que se hace evidente en un párrafo.
Qué muestra la página
Las sondas se ejecutan cada 30 segundos desde fuera de nuestra propia red. El historial se conserva durante 90 días.
Por sitio, no por flota
Los 34 sitios se enumeran por separado. Un problema en una ciudad no contamina a las demás, porque una cifra de disponibilidad agregada oculta exactamente la interrupción para la que has venido a esta página.
Seis componentes por sitio
Red, hipervisor, almacenamiento, aprovisionamiento, panel y API, cada uno verificado de forma independiente. Que una cola de aprovisionamiento esté acumulando trabajo no implica que tus instancias en ejecución estén caídas.
Medido desde el exterior
Las sondas se encuentran en redes que no operamos, en varias regiones, y una comprobación debe fallar desde más de un punto antes de que algo cambie de color. Monitorear una red desde dentro mide muy poco.
La misma cifra de disponibilidad que el SLA
99.993% en los últimos 12 meses, calculado a partir de estas sondas y no de una definición más favorable. El tiempo de inactividad cuenta desde la primera comprobación fallida, no desde el momento en que alguien lo reconoció.
Notas posteriores al incidente
Cualquier incidente clasificado como P1 o P2 recibe un seguimiento por escrito en un plazo de 5 días laborables: qué se rompió, qué se hizo, qué cambió después. Son deliberadamente aburridos y nunca se eliminan silenciosamente.
Cómo se clasifican los incidentes
Cuatro niveles, asignados por el ingeniero de guardia en minutos y revisados al alza sin dudar cuando el panorama cambia. Nada se reclasifica a la baja después para que un informe se lea mejor.
| Nivel | Significado | Primera actualización | Luego |
|---|---|---|---|
| P1 | Instancias de clientes caídas o inaccesibles en un sitio, o una falla que afecta a más de un sitio. | En 15 minutos | Cada 30 minutos hasta la resolución |
| P2 | Degradación severa. Pérdida de paquetes, latencia de almacenamiento o un componente caído mientras las instancias siguen funcionando. | En 30 minutos | Cada hora |
| P3 | Fallo del plano de control. Aprovisionamiento, panel, API o facturación no disponibles mientras las instancias en ejecución no se ven afectadas. | En 2 horas | Dos veces al día |
| P4 | Cosmético o de instancia única. Un elemento de cola atascado, un gráfico incorrecto, un nodo degradado con un repuesto en caliente que ya lo está respaldando. | Siguiente día laborable | En la resolución |
La falla de una sola instancia de cliente es un P4 en esta página y un ticket con una mediana de respuesta de 11 minutos en el panel. El nivel describe el radio de impacto, no cuánto te afecta a ti.
Mantenimiento
El mantenimiento planificado se anuncia con al menos 7 días de antelación, por correo a las cuentas afectadas y en la página de estado. Los revendedores tienen 14 días. Cada aviso menciona el sitio, la ventana, el impacto esperado y si implica un reinicio.
Las ventanas se ejecutan de 01:00 a 05:00 hora local del sitio, que es la única opción razonable cuando la flota abarca 29 países y alguien siempre está despierto. La mayoría del trabajo termina dentro de la primera hora.
Cuando una carga de trabajo puede migrarse en vivo, se hace, y el efecto visible es unos segundos de latencia adicional en lugar de un reinicio. El firmware, el kernel y el hipervisor no se pueden actualizar de esa manera, y el aviso lo dice claramente en lugar de ocultar un reinicio detrás de la palabra «breve».
Mantenimiento de emergencia
Se anuncia en cuanto se decide, a veces con menos de una hora de antelación. Reservado para un parche de seguridad bajo explotación activa, o hardware que va a fallar de todas formas.
Aplazamientos
Uno por instancia y trimestre, mediante ticket, hasta 14 días. Más allá de eso, el nodo debe actualizarse, y te ayudaremos a planificar en torno a la fecha en lugar de moverla de nuevo.
Lo que nunca ocurre en una ventana
Cambios de precios, cambios de política y cualquier cosa que toque tus datos. El mantenimiento cubre el hardware y el software que operamos, nunca el contenido de tus discos.
Cómo te avisamos
Cuatro formas de suscribirse. Ninguna requiere cuenta, y ninguna se usará jamás para enviarte nada que no sean incidencias.
Feed Atom
Un feed para todo, o uno por sitio. Es la opción que sigue funcionando cuando el correo no lo hace, que durante una incidencia de red es precisamente tu situación.
Correo por sitio
Suscribe una dirección a las ciudades que usas. Los clientes quedan suscritos automáticamente a sus propios sitios y pueden desactivarlo, aunque preferiríamos que no lo hicieras.
Webhooks
Un POST firmado en cada cambio de estado, para quien quiera enrutar incidencias a sus propias herramientas. Misma forma de payload que la API, reintentado con backoff durante 24 horas.
La API de estado
Un endpoint público de solo lectura que devuelve el estado actual y las incidencias abiertas como JSON. Sin token, con límite de velocidad educado, y sin cambios desde 2024.
Ese es el único uso de la dirección. No hay boletín, ni lista de anuncios de producto, ni lista de marketing en la que una suscripción de estado te apunte silenciosamente.
Preguntas sobre el estado
Porque mide sitios y componentes, no instancias individuales. Un nodo o una instancia es un ticket, no una incidencia pública, y el ticket es, con diferencia, la vía más rápida para una solución.
Deliberadamente no en la infraestructura que vigila. Se sirve desde un sitio separado con tránsito separado, para que una avería de red no pueda tumbar la página que describe esa avería.
Las ventanas anunciadas no cuentan para la cifra del SLA. Todo lo demás sí, incluidas las caídas que fueron culpa nuestra y las que fueron de otro.
Noventa días en la propia página, e indefinidamente para los informes P1 y P2. Las incidencias antiguas no se eliminan cuando dejan de ser halagadoras.
Cada página de sitio incluye los tiempos de ida y vuelta de las sondas desde los cuatro hubs de referencia, actualizados continuamente. Las cifras impresas en las páginas de ubicación son medianas de esos mismos datos.
Suscríbete antes de que lo necesites
El feed y el correo por sitio requieren una dirección y unos diez segundos. Hacerlo durante una incidencia es posible y considerablemente menos agradable.