Ce qui est cassé, et depuis quand
La page de statut est alimentée par les mêmes sondes qui réveillent l'ingénieur d'astreinte. Aucune étape éditoriale ne se situe entre un contrôle en échec et un panneau rouge, ce qui est délibéré et occasionnellement embarrassant.
90 jours · Les chiffres de latence sont des médianes mesurées depuis nos propres sondes, pas des brochures de fournisseurs. Ils bougent ; la page se met à jour en conséquence.
Journal
Un journal d'ingénierie. Les incidents donnent lieu à une analyse post-incident avec de vrais horodatages, les décisions matérielles incluent les chiffres qui les ont motivées, et les changements de politique exposent le raisonnement même lorsqu'il nous fait paraître lents. Rien ici n'a été écrit par un service marketing, ce qui devient évident au bout d'un paragraphe.
Ce que montre la page
Les sondes s'exécutent toutes les 30 secondes depuis l'extérieur de notre propre réseau. L'historique reste disponible pendant 90 jours.
Par site, pas par flotte
Les 34 sites sont listés séparément. Un problème dans une ville ne colore pas les autres, car une disponibilité agrégée cache précisément la panne pour laquelle vous êtes venu sur cette page.
Six composants par site
Réseau, hyperviseur, stockage, provisionnement, panneau et API, chacun vérifié indépendamment. Une file de provisionnement qui s'engorge ne prétend donc pas que vos instances en cours d'exécution sont down.
Mesuré de l'extérieur
Les sondes se trouvent sur des réseaux que nous n'exploitons pas, dans plusieurs régions, et une vérification doit échouer depuis plus d'une avant que quoi que ce soit ne change de couleur. Surveiller un réseau depuis l'intérieur ne mesure pas grand-chose.
Le même chiffre de disponibilité que le SLA
99,993 % sur les 12 derniers mois glissants, calculé à partir de ces sondes plutôt que d'une définition plus clémente. Les pannes comptent à partir du premier échec, pas au moment où quelqu'un l'a reconnu.
Notes post-incident
Tout élément classé P1 ou P2 reçoit un compte-rendu écrit sous 5 jours ouvrés : ce qui a cassé, ce qui a été fait, ce qui a changé ensuite. Ils sont volontairement ternes et ne sont jamais discrètement supprimés.
Comment les incidents sont classés
Quatre niveaux, attribués par l'ingénieur d'astreinte en quelques minutes et révisés à la hausse sans hésitation lorsque la situation change. Rien n'est déclassé ensuite pour améliorer le rapport.
| Niveau | Signification | Première mise à jour | Ensuite |
|---|---|---|---|
| P1 | Instances client down ou injoignables sur un site, ou panne affectant plus d'un site. | Sous 15 minutes | Toutes les 30 minutes jusqu'à résolution |
| P2 | Dégradation sévère. Perte de paquets, latence de stockage ou un composant down pendant que les instances continuent de servir. | Sous 30 minutes | Chaque heure |
| P3 | Panne du plan de contrôle. Provisionnement, panneau, API ou facturation indisponibles pendant que les instances en cours d'exécution ne sont pas affectées. | Sous 2 heures | Deux fois par jour |
| P4 | Cosmétique ou instance unique. Un élément de file bloqué, un graphe erroné, un nœud dégradé déjà pris en charge par un spare à chaud. | Jour ouvré suivant | À la résolution |
Une instance client unique qui échoue est un P4 sur cette page et un ticket avec un temps de réponse médian de 11 minutes dans le panneau. Le niveau décrit le rayon d'impact plutôt que son importance pour vous.
Maintenance
Les maintenances planifiées sont annoncées au moins 7 jours à l'avance, par courriel aux comptes concernés et sur la page de statut. Les revendeurs bénéficient de 14 jours. Chaque avis nomme le site, la fenêtre, l'impact attendu et si un redémarrage est impliqué.
Les fenêtres s'étendent de 01h00 à 05h00 heure locale du site, ce qui est le seul choix raisonnable quand la flotte s'étend sur 29 pays et que quelqu'un est toujours éveillé. La plupart des travaux se terminent dans la première heure.
Lorsqu'une charge de travail peut être migrée à chaud, elle l'est, et l'effet visible est quelques secondes de latence supplémentaire plutôt qu'un redémarrage. Les travaux de firmware, noyau et hyperviseur ne peuvent pas être effectués de cette façon, et l'avis le dit clairement au lieu de cacher un redémarrage derrière le mot « bref ».
Maintenance d'urgence
Annoncée dès qu'elle est décidée, parfois avec moins d'une heure de préavis. Réservée à un correctif de sécurité sous exploitation active, ou à du matériel qui va tomber de toute façon.
Reports
Un par instance et par trimestre, par ticket, jusqu'à 14 jours. Au-delà, le nœud doit être fait, et nous vous aiderons à planifier autour de la date plutôt que de la déplacer à nouveau.
Ce qui n'arrive jamais pendant une fenêtre
Changements de prix, changements de politique, et tout ce qui touche à vos données. La maintenance couvre le matériel et les logiciels que nous exploitons, jamais le contenu de vos disques.
Être informé
Quatre façons de s'abonner. Aucune ne nécessite de compte, et aucune ne servira jamais à vous envoyer autre chose que des incidents.
Flux Atom
Un flux pour tout, ou un par site. C'est l'option qui continue de fonctionner quand la messagerie ne fonctionne pas, ce qui, lors d'un incident réseau, est précisément la situation dans laquelle vous vous trouvez.
E-mail par site
Abonnez une adresse aux villes que vous utilisez. Les clients sont abonnés automatiquement à leurs propres sites et peuvent le désactiver, même si nous préférerions que vous ne le fassiez pas.
Webhooks
Un POST signé à chaque changement d'état, pour ceux qui intègrent les incidents dans leurs propres outils. Même forme de payload que l'API, avec nouvelle tentative avec backoff pendant 24 heures.
L'API de statut
Un endpoint public en lecture seule renvoyant l'état actuel et les incidents ouverts en JSON. Aucun jeton requis, limité en débit de manière polie, et inchangé depuis 2024.
C'est tout l'usage de l'adresse. Il n'y a pas de newsletter, pas de liste d'annonces produits, et aucune liste marketing dans laquelle un abonnement au statut vous inscrit discrètement.
Questions sur le statut
Parce qu'elle suit les sites et les composants plutôt que des instances individuelles. Un nœud ou une instance en panne est un ticket, pas un incident public, et le ticket est de loin le moyen le plus rapide d'obtenir une correction.
Délibérément pas sur l'infrastructure qu'elle surveille. Elle est servie depuis un site séparé avec un transit séparé, de sorte qu'une panne réseau ne peut pas faire tomber la page qui décrit cette panne.
Les fenêtres annoncées ne comptent pas dans le chiffre du SLA. Tout le reste compte, y compris les pannes qui étaient de notre faute et celles qui étaient de la faute de quelqu'un d'autre.
Quatre-vingt-dix jours sur la page elle-même, et indéfiniment pour les comptes rendus P1 et P2. Les anciens incidents ne sont pas supprimés une fois qu'ils cessent d'être flatteurs.
Chaque page de site affiche les temps de round-trip des sondes depuis les quatre hubs de référence, mis à jour en continu. Les chiffres imprimés sur les pages de localisation sont des médianes de ces mêmes données.
Abonnez-vous avant d'en avoir besoin
Le flux et l'e-mail par site nécessitent une adresse et environ dix secondes. Le faire pendant un incident est possible et considérablement moins agréable.