Operacje

Co jest zepsute i od kiedy

Strona statusu jest zasilana przez te same proby, które budzą inżyniera dyżurnego. Żaden etap redakcyjny nie znajduje się między nieudaną kontrolą a czerwonym panelem, co jest celowe i od czasu do czasu żenujące.

Flota
dostępność 12 miesięcy99.993%
Cel SLA99.99%
lokalizacje34
Otwarte incydenty0
Wszystkie systemy działają
Europe
North America
MIA-01 Miami100.000%
Latin America
Asia-Pacific
Middle East & Africa

90 dni · Wartości latencji to zmierzone mediany z naszych własnych sond, a nie broszury sprzedawców. Zmieniają się; strona aktualizuje się, gdy się zmieniają.

01

Co pokazuje strona

Proby uruchamiane są co 30 sekund z zewnątrz naszej sieci. Historia pozostaje dostępna przez 90 dni.

01

Na lokację, a nie na całą sieć

Wszystkie 34 lokacje są wymienione osobno. Problem w jednym mieście nie wpływa na pozostałe, ponieważ zagregowana wartość dostępności ukrywa dokładnie tę awarię, o którą chodziło Ci, odwiedzając tę stronę.

02

Sześć komponentów na lokację

Sieć, hipervisor, magazyn, provisioning, panel i API — każdy sprawdzany niezależnie. Zablokowana kolejka provisioning nie oznacza, że Twoje działające instancje są niedostępne.

03

Mierzone z zewnątrz

Proby znajdują się w sieciach, których nie obsługujemy, w kilku regionach, a kontrola musi zakończyć się niepowodzeniem w więcej niż jednej z nich, zanim cokolwiek zmieni kolor. Monitorowanie sieci od wewnątrz niewiele mierzy.

04

Ta sama wartość dostępności co w SLA

99.993% w ciągu ostatnich 12 miesięcy, obliczone na podstawie tych prób, a nie bardziej przyjaznej definicji. Przestój liczony jest od pierwszej nieudanej kontroli, a nie od momentu, gdy ktoś to potwierdził.

05

Notatki po incydentach

Wszystko, co otrzyma ocenę P1 lub P2, otrzymuje pisemne podsumowanie w ciągu 5 dni roboczych: co się zepsuło, co zrobiono, co zmieniono później. Są celowo nudne i nigdy nie są po cichu usuwane.

02

Jak klasyfikowane są incydenty

Cztery poziomy, przypisywane przez dyżurnego inżyniera w ciągu kilku minut i bez wahania korygowane w górę, gdy obraz sytuacji się zmienia. Nic nie jest później obniżane, aby raport wyglądał lepiej.

PoziomZnaczeniePierwsza aktualizacjaNastępnie
P1Instancje klientów w dół lub nieosiągalne w lokacji, albo awaria dotycząca więcej niż jednej lokacji.W ciągu 15 minutCo 30 minut do czasu rozwiązania
P2Poważna degradacja. Utracone pakiety, opóźnienia magazynu lub komponent w dół, podczas gdy instancje nadal działają.W ciągu 30 minutCo godzinę
P3Awaria płaszczyzny sterowania. Provisioning, panel, API lub billing niedostępne, podczas gdy działające instancje nie są dotknięte.W ciągu 2 godzinDwa razy dziennie
P4Kosmetyczna lub dotycząca pojedynczej instancji. Zablokowana pozycja w kolejce, błędny wykres, jeden węzeł zdegradowany z gorącą rezerwą, która już go obsługuje.Następny dzień roboczyPo rozwiązaniu

Awaria pojedynczej instancji klienta to P4 na tej stronie i ticket z medianą odpowiedzi 11 minut w panelu. Klasa opisuje promień rażenia, a nie to, jak bardzo jest to dla Ciebie ważne.

03

Prace serwisowe

Planowane prace serwisowe są ogłaszane z co najmniej 7-dniowym wyprzedzeniem, pocztą do dotkniętych kont oraz na stronie statusu. Resellerzy otrzymują 14 dni. Każde powiadomienie podaje lokalizację, okno, przewidywany wpływ oraz to, czy wiąże się z ponownym uruchomieniem.

Okna czasowe rozpoczynają się od 01:00 do 05:00 czasu lokalnego w danej lokalizacji, co jest jedynym rozsądnym wyborem, gdy flota obejmuje 29 krajów i ktoś zawsze nie śpi. Większość prac kończy się w pierwszej godzinie.

Tam, gdzie obciążenie można przenieść na żywo, jest to robione, a widoczny efekt to kilka sekund dodatkowych opóźnień, a nie restart. Prace nad oprogramowaniem układowym, jądrem i hipervisorem nie mogą być wykonane w ten sposób, a powiadomienie mówi o tym wprost, zamiast ukrywać restart za słowem „krótki”.

01

Awaryjne prace serwisowe

Ogłaszane natychmiast po podjęciu decyzji, czasami z mniej niż godziną ostrzeżenia. Zarezerwowane dla poprawki bezpieczeństwa przy aktywnej eksploatacji lub sprzętu, który i tak ulegnie awarii.

02

Przesunięcia

Jedno na instancję na kwartał, przez ticket, do 14 dni. Po tym terminie węzeł musi być gotowy, a my pomożemy Ci zaplanować prace wokół tej daty, zamiast przesuwać ją ponownie.

03

Co nigdy nie zdarza się w oknie

Zmiany cen, zmiany polityki i wszystko, co dotyka Twoich danych. Konserwacja obejmuje sprzęt i oprogramowanie, które obsługujemy, nigdy zawartość Twoich dysków.

04

Informowanie o tym

Cztery sposoby subskrypcji. Żaden z nich nie wymaga konta i żaden nie zostanie użyty do wysyłania czegokolwiek poza incydentami.

01

Kanał Atom

Jeden kanał dla wszystkiego lub jeden na witrynę. To opcja, która działa, gdy poczta nie działa, co podczas incydentu sieciowego jest dokładnie Twoją sytuacją.

02

E-mail na witrynę

Subskrybuj adres dla miast, których używasz. Klienci są automatycznie subskrybowani do własnych witryn i mogą to wyłączyć, choć wolelibyśmy, aby tego nie robili.

03

Webhooki

Podpisany POST przy każdej zmianie stanu, dla tych, którzy kierują incydenty do własnych narzędzi. Taki sam kształt ładunku jak API, ponawiany z backoffem przez 24 godziny.

04

API statusu

Publiczny endpoint tylko do odczytu zwracający bieżący stan i otwarte incydenty jako JSON. Bez tokena, z uprzejmym limitowaniem szybkości, niezmieniony od 2024.

To jest całe wykorzystanie adresu. Nie ma newslettera, listy ogłoszeń o produktach ani listy marketingowej, do której subskrypcja statusu cicho Cię zapisuje.

05

Pytania o status

Ponieważ śledzi witryny i komponenty, a nie pojedyncze instancje. Jeden węzeł lub jedna instancja to ticket, a nie publiczny incydent, a ticket jest znacznie szybszą drogą do naprawy.

Celowo nie na infrastrukturze, którą obserwuje. Jest serwowana z osobnej witryny z osobnym tranzytem, więc awaria sieci nie może wyłączyć strony opisującej tę awarię.

Zapowiedziane okna nie są wliczane do SLA. Wszystko inne się liczy, w tym awarie, które były naszą winą, i te, które były czyjąś.

Dziewięćdziesiąt dni na samej stronie i bezterminowo dla opisów P1 i P2. Stare incydenty nie są usuwane, gdy przestają być pochlebne.

Każda strona witryny zawiera czasy Round-Trip z czterech hubów referencyjnych, aktualizowane w sposób ciągły. Liczby widoczne na stronach lokalizacji to mediany tych samych danych.

Gotowi, gdy jesteś

Subskrybuj, zanim będzie potrzebne

Kanał i e-mail na witrynę wymagają jednego adresu i około dziesięciu sekund. Robienie tego podczas incydentu jest możliwe i znacznie mniej przyjemne.