Operazioni

Cosa è rotto, e da quando

La pagina di stato è alimentata dalle stesse sonde che svegliano l'ingegnere di turno. Nessun passaggio editoriale si interpone tra un controllo fallito e un pannello rosso, il che è deliberato e occasionalmente imbarazzante.

Flotta
uptime 12 mesi99.993%
Obiettivo SLA99.99%
siti34
Incidenti aperti0
Tutti i sistemi operativi
Europe
North America
MIA-01 Miami100.000%
Latin America
Asia-Pacific
Middle East & Africa

90 giorni · I valori di latenza sono mediane misurate dalle nostre sonde, non brochure dei fornitori. Si aggiornano; la pagina si aggiorna quando lo fanno.

01

Cosa mostra la pagina

Le sonde girano ogni 30 secondi dall'esterno della nostra rete. La cronologia rimane per 90 giorni.

01

Per sito, non per flotta

Tutti i 34 siti sono elencati separatamente. Un problema in una città non influenza gli altri, perché una cifra di disponibilità aggregata nasconde esattamente l'interruzione per cui sei venuto su questa pagina.

02

Sei componenti per sito

Rete, hypervisor, storage, provisioning, pannello e API, ciascuno controllato indipendentemente. Una coda di provisioning in arretrato quindi non significa che le tue istanze in esecuzione siano giù.

03

Misurato dall'esterno

Le sonde si trovano su reti che non gestiamo noi, in diverse regioni, e un controllo deve fallire da più di una prima che qualcosa cambi colore. Monitorare una rete dall'interno misura molto poco.

04

La stessa cifra di uptime dell'SLA

99.993% negli ultimi 12 mesi mobili, calcolato da queste sonde piuttosto che da una definizione più accomodante. Il downtime conta dal primo controllo fallito, non dal momento in cui qualcuno lo ha riconosciuto.

05

Note post-incidente

Qualsiasi cosa classificata P1 o P2 riceve un follow-up scritto entro 5 giorni lavorativi: cosa si è rotto, cosa è stato fatto, cosa è cambiato dopo. Sono volutamente noiose e non vengono mai eliminate silenziosamente.

02

Come vengono classificati gli incidenti

Quattro livelli, assegnati dall'ingegnere di turno entro pochi minuti e rivisti al rialzo senza esitazione quando il quadro cambia. Niente viene declassato dopo per far sembrare migliore un rapporto.

LivelloSignificatoPrimo aggiornamentoPoi
P1Istanze cliente giù o irraggiungibili in un sito, o un guasto che coinvolge più di un sito.Entro 15 minutiOgni 30 minuti fino alla risoluzione
P2Degrado grave. Perdita di pacchetti, latenza di storage o un componente giù mentre le istanze continuano a servire.Entro 30 minutiOgni ora
P3Guasto al piano di controllo. Provisioning, pannello, API o fatturazione non disponibili mentre le istanze in esecuzione non sono influenzate.Entro 2 oreDue volte al giorno
P4Estetico o singola istanza. Una voce di coda bloccata, un grafico sbagliato, un nodo degradato con uno spare a caldo che già lo sostiene.Giorno lavorativo successivoAlla risoluzione

Un'istanza cliente singola che fallisce è una P4 su questa pagina e un ticket con una risposta mediana di 11 minuti nel pannello. Il grado descrive il raggio dell'esplosione piuttosto che quanto conta per te.

03

Manutenzione

La manutenzione programmata è annunciata con almeno 7 giorni di anticipo, via email agli account interessati e sulla pagina di stato. I reseller hanno 14 giorni. Ogni avviso nomina il sito, la finestra, l'impatto previsto e se è coinvolto un riavvio.

Le finestre vanno dalle 01:00 alle 05:00 ora locale del sito, che è l'unica scelta ragionevole quando la flotta abbraccia 29 paesi e qualcuno è sempre sveglio. La maggior parte dei lavori finisce nella prima ora.

Dove un carico di lavoro può essere migrato a caldo, lo è, e l'effetto visibile è qualche secondo di latenza aggiuntiva piuttosto che un riavvio. Il lavoro su firmware, kernel e hypervisor non può essere fatto in quel modo, e l'avviso lo dice chiaramente invece di nascondere un riavvio dietro la parola "breve".

01

Manutenzione d'emergenza

Annunciata non appena decisa, a volte con meno di un'ora di preavviso. Riservata a una correzione di sicurezza sotto sfruttamento attivo o a hardware che fallirà comunque.

02

Rinvii

Uno per istanza per trimestre, tramite ticket, fino a 14 giorni. Oltre quel limite il nodo va fatto, e ti aiuteremo a pianificare attorno alla data piuttosto che spostarla di nuovo.

03

Cosa non accade mai in una finestra

Modifiche ai prezzi, modifiche alle policy, e qualsiasi cosa tocchi i tuoi dati. La manutenzione copre hardware e software che gestiamo noi, mai il contenuto dei tuoi dischi.

04

Essere informati

Quattro modi per iscriversi. Nessuno richiede un account, e nessuno verrà mai usato per inviarti altro che non siano incidenti.

01

Feed Atom

Un feed per tutto, o uno per sito. È l'opzione che continua a funzionare quando la posta non arriva, che durante un incidente di rete è esattamente la situazione in cui ti trovi.

02

Email per sito

Iscrivi un indirizzo alle città che usi. I clienti sono iscritti automaticamente ai propri siti e possono disattivare, anche se preferiremmo di no.

03

Webhook

Un POST firmato a ogni cambio di stato, per chi instrada gli incidenti nei propri strumenti. Stessa forma del payload dell'API, ritentato con backoff per 24 ore.

04

API di stato

Un endpoint pubblico in sola lettura che restituisce lo stato corrente e gli incidenti aperti come JSON. Nessun token richiesto, limitato con cortesia, e invariato dal 2024.

Questo è l'unico uso dell'indirizzo. Non c'è newsletter, nessuna mailing di annunci di prodotto, e nessuna lista di marketing in cui una sottoscrizione allo stato ti iscriva di nascosto.

05

Domande sullo stato

Perché traccia siti e componenti, non singole istanze. Un nodo o un'istanza è un ticket, non un incidente pubblico, e il ticket è di gran lunga la strada più veloce per una soluzione.

Deliberatamente non sull'infrastruttura che osserva. È servita da un sito separato con transito separato, così un guasto di rete non può far cadere la pagina che descrive quel guasto.

Le finestre annunciate non contano ai fini del SLA. Tutto il resto sì, inclusi i guasti che sono stati colpa nostra e quelli che sono stati colpa di qualcun altro.

Novanta giorni sulla pagina stessa, e a tempo indeterminato per i resoconti P1 e P2. I vecchi incidenti non vengono rimossi quando smettono di essere lusinghieri.

Ogni pagina di sito riporta i tempi di round-trip dei probe dai quattro hub di riferimento, aggiornati in continuo. Le cifre stampate sulle pagine delle località sono le mediane di questi stessi dati.

Pronto quando lo sei

Iscriviti prima che ti serva

Il feed e la mail per sito richiedono un indirizzo e circa dieci secondi. Farlo durante un incidente è possibile e decisamente meno piacevole.