Opérations

Ce qui est cassé, et depuis quand

La page de statut est alimentée par les mêmes sondes qui réveillent l'ingénieur d'astreinte. Aucune étape éditoriale ne se situe entre un contrôle en échec et un panneau rouge, ce qui est délibéré et occasionnellement embarrassant.

Parc
disponibilité sur 12 mois99.993%
Objectif SLA99.99%
sites34
Incidents ouverts0
Tous les systèmes fonctionnent
Europe
North America
MIA-01 Miami100.000%
Latin America
Asia-Pacific
Middle East & Africa

90 jours · Les chiffres de latence sont des médianes mesurées depuis nos propres sondes, pas des brochures de fournisseurs. Ils bougent ; la page se met à jour en conséquence.

01

Ce que montre la page

Les sondes s'exécutent toutes les 30 secondes depuis l'extérieur de notre propre réseau. L'historique reste disponible pendant 90 jours.

01

Par site, pas par flotte

Les 34 sites sont listés séparément. Un problème dans une ville ne colore pas les autres, car une disponibilité agrégée cache précisément la panne pour laquelle vous êtes venu sur cette page.

02

Six composants par site

Réseau, hyperviseur, stockage, provisionnement, panneau et API, chacun vérifié indépendamment. Une file de provisionnement qui s'engorge ne prétend donc pas que vos instances en cours d'exécution sont down.

03

Mesuré de l'extérieur

Les sondes se trouvent sur des réseaux que nous n'exploitons pas, dans plusieurs régions, et une vérification doit échouer depuis plus d'une avant que quoi que ce soit ne change de couleur. Surveiller un réseau depuis l'intérieur ne mesure pas grand-chose.

04

Le même chiffre de disponibilité que le SLA

99,993 % sur les 12 derniers mois glissants, calculé à partir de ces sondes plutôt que d'une définition plus clémente. Les pannes comptent à partir du premier échec, pas au moment où quelqu'un l'a reconnu.

05

Notes post-incident

Tout élément classé P1 ou P2 reçoit un compte-rendu écrit sous 5 jours ouvrés : ce qui a cassé, ce qui a été fait, ce qui a changé ensuite. Ils sont volontairement ternes et ne sont jamais discrètement supprimés.

02

Comment les incidents sont classés

Quatre niveaux, attribués par l'ingénieur d'astreinte en quelques minutes et révisés à la hausse sans hésitation lorsque la situation change. Rien n'est déclassé ensuite pour améliorer le rapport.

NiveauSignificationPremière mise à jourEnsuite
P1Instances client down ou injoignables sur un site, ou panne affectant plus d'un site.Sous 15 minutesToutes les 30 minutes jusqu'à résolution
P2Dégradation sévère. Perte de paquets, latence de stockage ou un composant down pendant que les instances continuent de servir.Sous 30 minutesChaque heure
P3Panne du plan de contrôle. Provisionnement, panneau, API ou facturation indisponibles pendant que les instances en cours d'exécution ne sont pas affectées.Sous 2 heuresDeux fois par jour
P4Cosmétique ou instance unique. Un élément de file bloqué, un graphe erroné, un nœud dégradé déjà pris en charge par un spare à chaud.Jour ouvré suivantÀ la résolution

Une instance client unique qui échoue est un P4 sur cette page et un ticket avec un temps de réponse médian de 11 minutes dans le panneau. Le niveau décrit le rayon d'impact plutôt que son importance pour vous.

03

Maintenance

Les maintenances planifiées sont annoncées au moins 7 jours à l'avance, par courriel aux comptes concernés et sur la page de statut. Les revendeurs bénéficient de 14 jours. Chaque avis nomme le site, la fenêtre, l'impact attendu et si un redémarrage est impliqué.

Les fenêtres s'étendent de 01h00 à 05h00 heure locale du site, ce qui est le seul choix raisonnable quand la flotte s'étend sur 29 pays et que quelqu'un est toujours éveillé. La plupart des travaux se terminent dans la première heure.

Lorsqu'une charge de travail peut être migrée à chaud, elle l'est, et l'effet visible est quelques secondes de latence supplémentaire plutôt qu'un redémarrage. Les travaux de firmware, noyau et hyperviseur ne peuvent pas être effectués de cette façon, et l'avis le dit clairement au lieu de cacher un redémarrage derrière le mot « bref ».

01

Maintenance d'urgence

Annoncée dès qu'elle est décidée, parfois avec moins d'une heure de préavis. Réservée à un correctif de sécurité sous exploitation active, ou à du matériel qui va tomber de toute façon.

02

Reports

Un par instance et par trimestre, par ticket, jusqu'à 14 jours. Au-delà, le nœud doit être fait, et nous vous aiderons à planifier autour de la date plutôt que de la déplacer à nouveau.

03

Ce qui n'arrive jamais pendant une fenêtre

Changements de prix, changements de politique, et tout ce qui touche à vos données. La maintenance couvre le matériel et les logiciels que nous exploitons, jamais le contenu de vos disques.

04

Être informé

Quatre façons de s'abonner. Aucune ne nécessite de compte, et aucune ne servira jamais à vous envoyer autre chose que des incidents.

01

Flux Atom

Un flux pour tout, ou un par site. C'est l'option qui continue de fonctionner quand la messagerie ne fonctionne pas, ce qui, lors d'un incident réseau, est précisément la situation dans laquelle vous vous trouvez.

02

E-mail par site

Abonnez une adresse aux villes que vous utilisez. Les clients sont abonnés automatiquement à leurs propres sites et peuvent le désactiver, même si nous préférerions que vous ne le fassiez pas.

03

Webhooks

Un POST signé à chaque changement d'état, pour ceux qui intègrent les incidents dans leurs propres outils. Même forme de payload que l'API, avec nouvelle tentative avec backoff pendant 24 heures.

04

L'API de statut

Un endpoint public en lecture seule renvoyant l'état actuel et les incidents ouverts en JSON. Aucun jeton requis, limité en débit de manière polie, et inchangé depuis 2024.

C'est tout l'usage de l'adresse. Il n'y a pas de newsletter, pas de liste d'annonces produits, et aucune liste marketing dans laquelle un abonnement au statut vous inscrit discrètement.

05

Questions sur le statut

Parce qu'elle suit les sites et les composants plutôt que des instances individuelles. Un nœud ou une instance en panne est un ticket, pas un incident public, et le ticket est de loin le moyen le plus rapide d'obtenir une correction.

Délibérément pas sur l'infrastructure qu'elle surveille. Elle est servie depuis un site séparé avec un transit séparé, de sorte qu'une panne réseau ne peut pas faire tomber la page qui décrit cette panne.

Les fenêtres annoncées ne comptent pas dans le chiffre du SLA. Tout le reste compte, y compris les pannes qui étaient de notre faute et celles qui étaient de la faute de quelqu'un d'autre.

Quatre-vingt-dix jours sur la page elle-même, et indéfiniment pour les comptes rendus P1 et P2. Les anciens incidents ne sont pas supprimés une fois qu'ils cessent d'être flatteurs.

Chaque page de site affiche les temps de round-trip des sondes depuis les quatre hubs de référence, mis à jour en continu. Les chiffres imprimés sur les pages de localisation sont des médianes de ces mêmes données.

Prêt quand vous l'êtes

Abonnez-vous avant d'en avoir besoin

Le flux et l'e-mail par site nécessitent une adresse et environ dix secondes. Le faire pendant un incident est possible et considérablement moins agréable.