Cosa è rotto, e da quando
La pagina di stato è alimentata dalle stesse sonde che svegliano l'ingegnere di turno. Nessun passaggio editoriale si interpone tra un controllo fallito e un pannello rosso, il che è deliberato e occasionalmente imbarazzante.
90 giorni · I valori di latenza sono mediane misurate dalle nostre sonde, non brochure dei fornitori. Si aggiornano; la pagina si aggiorna quando lo fanno.
Journal
Un diario di ingegneria. Gli incidenti ottengono un post-mortem con timestamp reali, le decisioni hardware ottengono i numeri che le hanno giustificate, e i cambi di policy ottengono le motivazioni anche quando quelle motivazioni ci fanno sembrare lenti. Nulla di tutto ciò è stato scritto da un dipartimento marketing, cosa che diventa evidente entro un paragrafo.
Cosa mostra la pagina
Le sonde girano ogni 30 secondi dall'esterno della nostra rete. La cronologia rimane per 90 giorni.
Per sito, non per flotta
Tutti i 34 siti sono elencati separatamente. Un problema in una città non influenza gli altri, perché una cifra di disponibilità aggregata nasconde esattamente l'interruzione per cui sei venuto su questa pagina.
Sei componenti per sito
Rete, hypervisor, storage, provisioning, pannello e API, ciascuno controllato indipendentemente. Una coda di provisioning in arretrato quindi non significa che le tue istanze in esecuzione siano giù.
Misurato dall'esterno
Le sonde si trovano su reti che non gestiamo noi, in diverse regioni, e un controllo deve fallire da più di una prima che qualcosa cambi colore. Monitorare una rete dall'interno misura molto poco.
La stessa cifra di uptime dell'SLA
99.993% negli ultimi 12 mesi mobili, calcolato da queste sonde piuttosto che da una definizione più accomodante. Il downtime conta dal primo controllo fallito, non dal momento in cui qualcuno lo ha riconosciuto.
Note post-incidente
Qualsiasi cosa classificata P1 o P2 riceve un follow-up scritto entro 5 giorni lavorativi: cosa si è rotto, cosa è stato fatto, cosa è cambiato dopo. Sono volutamente noiose e non vengono mai eliminate silenziosamente.
Come vengono classificati gli incidenti
Quattro livelli, assegnati dall'ingegnere di turno entro pochi minuti e rivisti al rialzo senza esitazione quando il quadro cambia. Niente viene declassato dopo per far sembrare migliore un rapporto.
| Livello | Significato | Primo aggiornamento | Poi |
|---|---|---|---|
| P1 | Istanze cliente giù o irraggiungibili in un sito, o un guasto che coinvolge più di un sito. | Entro 15 minuti | Ogni 30 minuti fino alla risoluzione |
| P2 | Degrado grave. Perdita di pacchetti, latenza di storage o un componente giù mentre le istanze continuano a servire. | Entro 30 minuti | Ogni ora |
| P3 | Guasto al piano di controllo. Provisioning, pannello, API o fatturazione non disponibili mentre le istanze in esecuzione non sono influenzate. | Entro 2 ore | Due volte al giorno |
| P4 | Estetico o singola istanza. Una voce di coda bloccata, un grafico sbagliato, un nodo degradato con uno spare a caldo che già lo sostiene. | Giorno lavorativo successivo | Alla risoluzione |
Un'istanza cliente singola che fallisce è una P4 su questa pagina e un ticket con una risposta mediana di 11 minuti nel pannello. Il grado descrive il raggio dell'esplosione piuttosto che quanto conta per te.
Manutenzione
La manutenzione programmata è annunciata con almeno 7 giorni di anticipo, via email agli account interessati e sulla pagina di stato. I reseller hanno 14 giorni. Ogni avviso nomina il sito, la finestra, l'impatto previsto e se è coinvolto un riavvio.
Le finestre vanno dalle 01:00 alle 05:00 ora locale del sito, che è l'unica scelta ragionevole quando la flotta abbraccia 29 paesi e qualcuno è sempre sveglio. La maggior parte dei lavori finisce nella prima ora.
Dove un carico di lavoro può essere migrato a caldo, lo è, e l'effetto visibile è qualche secondo di latenza aggiuntiva piuttosto che un riavvio. Il lavoro su firmware, kernel e hypervisor non può essere fatto in quel modo, e l'avviso lo dice chiaramente invece di nascondere un riavvio dietro la parola "breve".
Manutenzione d'emergenza
Annunciata non appena decisa, a volte con meno di un'ora di preavviso. Riservata a una correzione di sicurezza sotto sfruttamento attivo o a hardware che fallirà comunque.
Rinvii
Uno per istanza per trimestre, tramite ticket, fino a 14 giorni. Oltre quel limite il nodo va fatto, e ti aiuteremo a pianificare attorno alla data piuttosto che spostarla di nuovo.
Cosa non accade mai in una finestra
Modifiche ai prezzi, modifiche alle policy, e qualsiasi cosa tocchi i tuoi dati. La manutenzione copre hardware e software che gestiamo noi, mai il contenuto dei tuoi dischi.
Essere informati
Quattro modi per iscriversi. Nessuno richiede un account, e nessuno verrà mai usato per inviarti altro che non siano incidenti.
Feed Atom
Un feed per tutto, o uno per sito. È l'opzione che continua a funzionare quando la posta non arriva, che durante un incidente di rete è esattamente la situazione in cui ti trovi.
Email per sito
Iscrivi un indirizzo alle città che usi. I clienti sono iscritti automaticamente ai propri siti e possono disattivare, anche se preferiremmo di no.
Webhook
Un POST firmato a ogni cambio di stato, per chi instrada gli incidenti nei propri strumenti. Stessa forma del payload dell'API, ritentato con backoff per 24 ore.
API di stato
Un endpoint pubblico in sola lettura che restituisce lo stato corrente e gli incidenti aperti come JSON. Nessun token richiesto, limitato con cortesia, e invariato dal 2024.
Questo è l'unico uso dell'indirizzo. Non c'è newsletter, nessuna mailing di annunci di prodotto, e nessuna lista di marketing in cui una sottoscrizione allo stato ti iscriva di nascosto.
Domande sullo stato
Perché traccia siti e componenti, non singole istanze. Un nodo o un'istanza è un ticket, non un incidente pubblico, e il ticket è di gran lunga la strada più veloce per una soluzione.
Deliberatamente non sull'infrastruttura che osserva. È servita da un sito separato con transito separato, così un guasto di rete non può far cadere la pagina che descrive quel guasto.
Le finestre annunciate non contano ai fini del SLA. Tutto il resto sì, inclusi i guasti che sono stati colpa nostra e quelli che sono stati colpa di qualcun altro.
Novanta giorni sulla pagina stessa, e a tempo indeterminato per i resoconti P1 e P2. I vecchi incidenti non vengono rimossi quando smettono di essere lusinghieri.
Ogni pagina di sito riporta i tempi di round-trip dei probe dai quattro hub di riferimento, aggiornati in continuo. Le cifre stampate sulle pagine delle località sono le mediane di questi stessi dati.
Iscriviti prima che ti serva
Il feed e la mail per sito richiedono un indirizzo e circa dieci secondi. Farlo durante un incidente è possibile e decisamente meno piacevole.