Wat is er kapot, en sinds wanneer
De statuspagina wordt gevoed door dezelfde probes die de dienstdoende ingenieur wakker maken. Er zit geen redactionele stap tussen een falende controle en een rood paneel, wat bewust is en af en toe gênant.
90 dagen · Latentiecijfers zijn gemeten medianen van onze eigen probes, geen leveranciersbrochures. Ze bewegen; de pagina werkt bij wanneer ze dat doen.
Dagboek
Een technisch dagboek. Incidenten krijgen een analyse met echte tijdstempels, hardwarebeslissingen krijgen de cijfers die ertoe leidden, en beleidswijzigingen krijgen de onderbouwing, zelfs als die onderbouwing ons traag doet lijken. Niets hier is geschreven door een marketingafdeling, en dat wordt binnen een alinea duidelijk.
Wat de pagina toont
Probes draaien elke 30 seconden van buiten ons eigen netwerk. Geschiedenis blijft 90 dagen beschikbaar.
Per site, niet per vloot
Alle 34 locaties worden afzonderlijk vermeld. Een probleem in één stad kleurt de andere niet, omdat een geaggregeerd beschikbaarheidscijfer precies de uitval verbergt waarvoor je naar de pagina kwam.
Zes componenten per locatie
Netwerk, hypervisor, opslag, provisioning, paneel en API, elk onafhankelijk gecontroleerd. Een back-up van de provisioning-wachtrij betekent dus niet dat je draaiende instances down zijn.
Van buitenaf gemeten
Probes bevinden zich op netwerken die wij niet beheren, in verschillende regio's, en een controle moet vanuit meer dan één netwerk mislukken voordat er iets van kleur verandert. Een netwerk van binnenuit monitoren meet heel weinig.
Hetzelfde uptimecijfer als de SLA
99,993% over de afgelopen 12 maanden, berekend op basis van deze probes in plaats van een vriendelijkere definitie. Downtime telt vanaf de eerste mislukte controle, niet vanaf het moment dat iemand het erkende.
Evaluaties na incidenten
Alles met classificatie P1 of P2 krijgt binnen 5 werkdagen een schriftelijke follow-up: wat er kapot ging, wat er werd gedaan, wat er daarna veranderde. Ze zijn opzettelijk saai en worden nooit stilletjes verwijderd.
Hoe incidenten worden geclassificeerd
Vier niveaus, binnen enkele minuten toegewezen door de dienstdoende engineer en zonder aarzeling naar boven bijgesteld wanneer het beeld verandert. Er wordt achteraf niets verlaagd om een rapport beter te laten lezen.
| Niveau | Betekenis | Eerste update | Daarna |
|---|---|---|---|
| P1 | Klantinstances down of onbereikbaar op een locatie, of een storing die meer dan één locatie treft. | Binnen 15 minuten | Elke 30 minuten totdat het is opgelost |
| P2 | Ernstige degradatie. Pakketverlies, opslaglatentie, of een component die down is terwijl instances blijven draaien. | Binnen 30 minuten | Elk uur |
| P3 | Fout in het control plane. Provisioning, paneel, API of facturatie niet beschikbaar terwijl draaiende instances niet worden beïnvloed. | Binnen 2 uur | Tweemaal per dag |
| P4 | Cosmetisch of enkele instantie. Een vastgelopen wachtrij-item, een verkeerde grafiek, één node gedegradeerd met een warme reserve die het al overneemt. | Volgende werkdag | Bij oplossing |
Een enkele klantinstance die faalt is een P4 op deze pagina en een ticket met een mediane respons van 11 minuten in het paneel. De classificatie beschrijft de omvang van de impact, niet hoeveel het voor jou betekent.
Onderhoud
Gepland onderhoud wordt minstens 7 dagen van tevoren aangekondigd, per e-mail aan de getroffen accounts en op de statuspagina. Resellers krijgen 14 dagen. Elke melding vermeldt de locatie, het venster, de verwachte impact en of er een herstart bij betrokken is.
Vensters lopen van 01:00 tot 05:00 lokale tijd op de locatie, wat de enige redelijke keuze is wanneer de vloot 29 landen beslaat en er altijd iemand wakker is. De meeste werkzaamheden zijn binnen het eerste uur klaar.
Waar een workload live kan worden gemigreerd, gebeurt dat, en het zichtbare effect is een paar seconden extra latentie in plaats van een herstart. Firmware-, kernel- en hypervisorwerk kan niet op die manier worden gedaan, en de melding zegt dat duidelijk in plaats van een herstart te verbergen achter het woord 'kort'.
Spoedonderhoud
Aangekondigd zodra het is besloten, soms met minder dan een uur van tevoren. Gereserveerd voor een beveiligingsfix die actief wordt misbruikt, of hardware die toch zal falen.
Uitstel
Eenmaal per instance per kwartaal, per ticket, tot 14 dagen. Daarna moet de node worden afgehandeld, en we helpen je plannen rond de datum in plaats van het opnieuw te verplaatsen.
Wat nooit in een onderhoudsvenster gebeurt
Prijs- en beleidswijzigingen, en alles wat met uw gegevens te maken heeft. Onderhoud betreft hardware en software die wij beheren, nooit de inhoud van uw schijven.
Op de hoogte worden gehouden
Vier manieren om u te abonneren. Geen enkele vereist een account, en geen enkele wordt ooit gebruikt om u iets anders te sturen dan incidenten.
Atom-feed
Eén feed voor alles, of één per site. Dit is de optie die blijft werken als e-mail dat niet doet, wat tijdens een netwerkincedent precies de situatie is waarin u zich bevindt.
E-mail per site
Abonneer een adres op de steden die u gebruikt. Klanten worden automatisch geabonneerd op hun eigen sites en kunnen dit uitschakelen, al geven wij er de voorkeur aan dat u dat niet doet.
Webhooks
Een ondertekende POST bij elke statusverandering, voor wie incidenten in eigen tools wil verwerken. Zelfde payloadvorm als de API, 24 uur lang opnieuw geprobeerd met backoff.
De status-API
Een openbaar, alleen-lezen eindpunt dat de huidige status en openstaande incidenten als JSON retourneert. Geen token nodig, beleefd gelimiteerd, en ongewijzigd sinds 2024.
Dat is het enige gebruik van het adres. Er is geen nieuwsbrief, geen productaankondigingenmailing en geen marketinglijst waar een statusabonnement u stilletjes voor aanmeldt.
Statusvragen
Omdat de pagina sites en componenten bijhoudt, geen individuele instances. Eén node of één instance is een ticket, geen openbaar incident, en het ticket is veruit de snelste route naar een oplossing.
Bewust niet op de infrastructuur die erop wordt gevolgd. De pagina wordt geserveerd vanaf een aparte site met een aparte transitaansluiting, zodat een netwerkstoring de pagina die die storing beschrijft niet kan uitschakelen.
Aangekondigde onderhoudsvensters tellen niet mee voor de SLA. Al het andere wel, inclusief storingen die onze schuld waren en die van iemand anders.
Negentig dagen op de pagina zelf, en onbeperkt voor P1- en P2-rapporten. Oude incidenten worden niet verwijderd zodra ze niet meer flatteus zijn.
Elke sitepagina toont de round-trip-tijden van de vier referentie-hubs, continu bijgewerkt. De cijfers op de locatiepagina's zijn medianen van dezelfde gegevens.
Abonneer u voordat u het nodig heeft
De feed en de e-mail per site hebben één adres en ongeveer tien seconden nodig. Het tijdens een incident doen is mogelijk en aanzienlijk minder prettig.