Operaciones

Qué está roto, y desde cuándo

La página de estado se alimenta de las mismas sondas que despiertan al ingeniero de guardia. No hay ningún paso editorial entre una comprobación fallida y un panel rojo, lo cual es deliberado y ocasionalmente embarazoso.

Flota
Disponibilidad de 12 meses99.993%
Objetivo de SLA99.99%
sitios34
Incidentes abiertos0
Todos los sistemas operativos
Europe
North America
MIA-01 Miami100.000%
Latin America
Asia-Pacific
Middle East & Africa

90 días · Las cifras de latencia son medianas medidas desde nuestras propias sondas, no folletos de proveedores. Se mueven; la página se actualiza cuando lo hacen.

01

Qué muestra la página

Las sondas se ejecutan cada 30 segundos desde fuera de nuestra propia red. El historial se conserva durante 90 días.

01

Por sitio, no por flota

Los 34 sitios se enumeran por separado. Un problema en una ciudad no contamina a las demás, porque una cifra de disponibilidad agregada oculta exactamente la interrupción para la que has venido a esta página.

02

Seis componentes por sitio

Red, hipervisor, almacenamiento, aprovisionamiento, panel y API, cada uno verificado de forma independiente. Que una cola de aprovisionamiento esté acumulando trabajo no implica que tus instancias en ejecución estén caídas.

03

Medido desde el exterior

Las sondas se encuentran en redes que no operamos, en varias regiones, y una comprobación debe fallar desde más de un punto antes de que algo cambie de color. Monitorear una red desde dentro mide muy poco.

04

La misma cifra de disponibilidad que el SLA

99.993% en los últimos 12 meses, calculado a partir de estas sondas y no de una definición más favorable. El tiempo de inactividad cuenta desde la primera comprobación fallida, no desde el momento en que alguien lo reconoció.

05

Notas posteriores al incidente

Cualquier incidente clasificado como P1 o P2 recibe un seguimiento por escrito en un plazo de 5 días laborables: qué se rompió, qué se hizo, qué cambió después. Son deliberadamente aburridos y nunca se eliminan silenciosamente.

02

Cómo se clasifican los incidentes

Cuatro niveles, asignados por el ingeniero de guardia en minutos y revisados al alza sin dudar cuando el panorama cambia. Nada se reclasifica a la baja después para que un informe se lea mejor.

NivelSignificadoPrimera actualizaciónLuego
P1Instancias de clientes caídas o inaccesibles en un sitio, o una falla que afecta a más de un sitio.En 15 minutosCada 30 minutos hasta la resolución
P2Degradación severa. Pérdida de paquetes, latencia de almacenamiento o un componente caído mientras las instancias siguen funcionando.En 30 minutosCada hora
P3Fallo del plano de control. Aprovisionamiento, panel, API o facturación no disponibles mientras las instancias en ejecución no se ven afectadas.En 2 horasDos veces al día
P4Cosmético o de instancia única. Un elemento de cola atascado, un gráfico incorrecto, un nodo degradado con un repuesto en caliente que ya lo está respaldando.Siguiente día laborableEn la resolución

La falla de una sola instancia de cliente es un P4 en esta página y un ticket con una mediana de respuesta de 11 minutos en el panel. El nivel describe el radio de impacto, no cuánto te afecta a ti.

03

Mantenimiento

El mantenimiento planificado se anuncia con al menos 7 días de antelación, por correo a las cuentas afectadas y en la página de estado. Los revendedores tienen 14 días. Cada aviso menciona el sitio, la ventana, el impacto esperado y si implica un reinicio.

Las ventanas se ejecutan de 01:00 a 05:00 hora local del sitio, que es la única opción razonable cuando la flota abarca 29 países y alguien siempre está despierto. La mayoría del trabajo termina dentro de la primera hora.

Cuando una carga de trabajo puede migrarse en vivo, se hace, y el efecto visible es unos segundos de latencia adicional en lugar de un reinicio. El firmware, el kernel y el hipervisor no se pueden actualizar de esa manera, y el aviso lo dice claramente en lugar de ocultar un reinicio detrás de la palabra «breve».

01

Mantenimiento de emergencia

Se anuncia en cuanto se decide, a veces con menos de una hora de antelación. Reservado para un parche de seguridad bajo explotación activa, o hardware que va a fallar de todas formas.

02

Aplazamientos

Uno por instancia y trimestre, mediante ticket, hasta 14 días. Más allá de eso, el nodo debe actualizarse, y te ayudaremos a planificar en torno a la fecha en lugar de moverla de nuevo.

03

Lo que nunca ocurre en una ventana

Cambios de precios, cambios de política y cualquier cosa que toque tus datos. El mantenimiento cubre el hardware y el software que operamos, nunca el contenido de tus discos.

04

Cómo te avisamos

Cuatro formas de suscribirse. Ninguna requiere cuenta, y ninguna se usará jamás para enviarte nada que no sean incidencias.

01

Feed Atom

Un feed para todo, o uno por sitio. Es la opción que sigue funcionando cuando el correo no lo hace, que durante una incidencia de red es precisamente tu situación.

02

Correo por sitio

Suscribe una dirección a las ciudades que usas. Los clientes quedan suscritos automáticamente a sus propios sitios y pueden desactivarlo, aunque preferiríamos que no lo hicieras.

03

Webhooks

Un POST firmado en cada cambio de estado, para quien quiera enrutar incidencias a sus propias herramientas. Misma forma de payload que la API, reintentado con backoff durante 24 horas.

04

La API de estado

Un endpoint público de solo lectura que devuelve el estado actual y las incidencias abiertas como JSON. Sin token, con límite de velocidad educado, y sin cambios desde 2024.

Ese es el único uso de la dirección. No hay boletín, ni lista de anuncios de producto, ni lista de marketing en la que una suscripción de estado te apunte silenciosamente.

05

Preguntas sobre el estado

Porque mide sitios y componentes, no instancias individuales. Un nodo o una instancia es un ticket, no una incidencia pública, y el ticket es, con diferencia, la vía más rápida para una solución.

Deliberadamente no en la infraestructura que vigila. Se sirve desde un sitio separado con tránsito separado, para que una avería de red no pueda tumbar la página que describe esa avería.

Las ventanas anunciadas no cuentan para la cifra del SLA. Todo lo demás sí, incluidas las caídas que fueron culpa nuestra y las que fueron de otro.

Noventa días en la propia página, e indefinidamente para los informes P1 y P2. Las incidencias antiguas no se eliminan cuando dejan de ser halagadoras.

Cada página de sitio incluye los tiempos de ida y vuelta de las sondas desde los cuatro hubs de referencia, actualizados continuamente. Las cifras impresas en las páginas de ubicación son medianas de esos mismos datos.

Listo cuando tú lo estés

Suscríbete antes de que lo necesites

El feed y el correo por sitio requieren una dirección y unos diez segundos. Hacerlo durante una incidencia es posible y considerablemente menos agradable.