Co jest zepsute i od kiedy
Strona statusu jest zasilana przez te same proby, które budzą inżyniera dyżurnego. Żaden etap redakcyjny nie znajduje się między nieudaną kontrolą a czerwonym panelem, co jest celowe i od czasu do czasu żenujące.
90 dni · Wartości latencji to zmierzone mediany z naszych własnych sond, a nie broszury sprzedawców. Zmieniają się; strona aktualizuje się, gdy się zmieniają.
Dziennik
Inżynieryjny pamiętnik. Po incydentach publikujemy analizy z prawdziwymi znacznikami czasu, decyzje sprzętowe dostają liczby, które je uzasadniają, a zmiany polityki – uzasadnienie, nawet jeśli pokazuje nas w niekorzystnym świetle. Nic tutaj nie jest pisane przez dział marketingu, co staje się oczywiste po jednym akapicie.
Co pokazuje strona
Proby uruchamiane są co 30 sekund z zewnątrz naszej sieci. Historia pozostaje dostępna przez 90 dni.
Na lokację, a nie na całą sieć
Wszystkie 34 lokacje są wymienione osobno. Problem w jednym mieście nie wpływa na pozostałe, ponieważ zagregowana wartość dostępności ukrywa dokładnie tę awarię, o którą chodziło Ci, odwiedzając tę stronę.
Sześć komponentów na lokację
Sieć, hipervisor, magazyn, provisioning, panel i API — każdy sprawdzany niezależnie. Zablokowana kolejka provisioning nie oznacza, że Twoje działające instancje są niedostępne.
Mierzone z zewnątrz
Proby znajdują się w sieciach, których nie obsługujemy, w kilku regionach, a kontrola musi zakończyć się niepowodzeniem w więcej niż jednej z nich, zanim cokolwiek zmieni kolor. Monitorowanie sieci od wewnątrz niewiele mierzy.
Ta sama wartość dostępności co w SLA
99.993% w ciągu ostatnich 12 miesięcy, obliczone na podstawie tych prób, a nie bardziej przyjaznej definicji. Przestój liczony jest od pierwszej nieudanej kontroli, a nie od momentu, gdy ktoś to potwierdził.
Notatki po incydentach
Wszystko, co otrzyma ocenę P1 lub P2, otrzymuje pisemne podsumowanie w ciągu 5 dni roboczych: co się zepsuło, co zrobiono, co zmieniono później. Są celowo nudne i nigdy nie są po cichu usuwane.
Jak klasyfikowane są incydenty
Cztery poziomy, przypisywane przez dyżurnego inżyniera w ciągu kilku minut i bez wahania korygowane w górę, gdy obraz sytuacji się zmienia. Nic nie jest później obniżane, aby raport wyglądał lepiej.
| Poziom | Znaczenie | Pierwsza aktualizacja | Następnie |
|---|---|---|---|
| P1 | Instancje klientów w dół lub nieosiągalne w lokacji, albo awaria dotycząca więcej niż jednej lokacji. | W ciągu 15 minut | Co 30 minut do czasu rozwiązania |
| P2 | Poważna degradacja. Utracone pakiety, opóźnienia magazynu lub komponent w dół, podczas gdy instancje nadal działają. | W ciągu 30 minut | Co godzinę |
| P3 | Awaria płaszczyzny sterowania. Provisioning, panel, API lub billing niedostępne, podczas gdy działające instancje nie są dotknięte. | W ciągu 2 godzin | Dwa razy dziennie |
| P4 | Kosmetyczna lub dotycząca pojedynczej instancji. Zablokowana pozycja w kolejce, błędny wykres, jeden węzeł zdegradowany z gorącą rezerwą, która już go obsługuje. | Następny dzień roboczy | Po rozwiązaniu |
Awaria pojedynczej instancji klienta to P4 na tej stronie i ticket z medianą odpowiedzi 11 minut w panelu. Klasa opisuje promień rażenia, a nie to, jak bardzo jest to dla Ciebie ważne.
Prace serwisowe
Planowane prace serwisowe są ogłaszane z co najmniej 7-dniowym wyprzedzeniem, pocztą do dotkniętych kont oraz na stronie statusu. Resellerzy otrzymują 14 dni. Każde powiadomienie podaje lokalizację, okno, przewidywany wpływ oraz to, czy wiąże się z ponownym uruchomieniem.
Okna czasowe rozpoczynają się od 01:00 do 05:00 czasu lokalnego w danej lokalizacji, co jest jedynym rozsądnym wyborem, gdy flota obejmuje 29 krajów i ktoś zawsze nie śpi. Większość prac kończy się w pierwszej godzinie.
Tam, gdzie obciążenie można przenieść na żywo, jest to robione, a widoczny efekt to kilka sekund dodatkowych opóźnień, a nie restart. Prace nad oprogramowaniem układowym, jądrem i hipervisorem nie mogą być wykonane w ten sposób, a powiadomienie mówi o tym wprost, zamiast ukrywać restart za słowem „krótki”.
Awaryjne prace serwisowe
Ogłaszane natychmiast po podjęciu decyzji, czasami z mniej niż godziną ostrzeżenia. Zarezerwowane dla poprawki bezpieczeństwa przy aktywnej eksploatacji lub sprzętu, który i tak ulegnie awarii.
Przesunięcia
Jedno na instancję na kwartał, przez ticket, do 14 dni. Po tym terminie węzeł musi być gotowy, a my pomożemy Ci zaplanować prace wokół tej daty, zamiast przesuwać ją ponownie.
Co nigdy nie zdarza się w oknie
Zmiany cen, zmiany polityki i wszystko, co dotyka Twoich danych. Konserwacja obejmuje sprzęt i oprogramowanie, które obsługujemy, nigdy zawartość Twoich dysków.
Informowanie o tym
Cztery sposoby subskrypcji. Żaden z nich nie wymaga konta i żaden nie zostanie użyty do wysyłania czegokolwiek poza incydentami.
Kanał Atom
Jeden kanał dla wszystkiego lub jeden na witrynę. To opcja, która działa, gdy poczta nie działa, co podczas incydentu sieciowego jest dokładnie Twoją sytuacją.
E-mail na witrynę
Subskrybuj adres dla miast, których używasz. Klienci są automatycznie subskrybowani do własnych witryn i mogą to wyłączyć, choć wolelibyśmy, aby tego nie robili.
Webhooki
Podpisany POST przy każdej zmianie stanu, dla tych, którzy kierują incydenty do własnych narzędzi. Taki sam kształt ładunku jak API, ponawiany z backoffem przez 24 godziny.
API statusu
Publiczny endpoint tylko do odczytu zwracający bieżący stan i otwarte incydenty jako JSON. Bez tokena, z uprzejmym limitowaniem szybkości, niezmieniony od 2024.
To jest całe wykorzystanie adresu. Nie ma newslettera, listy ogłoszeń o produktach ani listy marketingowej, do której subskrypcja statusu cicho Cię zapisuje.
Pytania o status
Ponieważ śledzi witryny i komponenty, a nie pojedyncze instancje. Jeden węzeł lub jedna instancja to ticket, a nie publiczny incydent, a ticket jest znacznie szybszą drogą do naprawy.
Celowo nie na infrastrukturze, którą obserwuje. Jest serwowana z osobnej witryny z osobnym tranzytem, więc awaria sieci nie może wyłączyć strony opisującej tę awarię.
Zapowiedziane okna nie są wliczane do SLA. Wszystko inne się liczy, w tym awarie, które były naszą winą, i te, które były czyjąś.
Dziewięćdziesiąt dni na samej stronie i bezterminowo dla opisów P1 i P2. Stare incydenty nie są usuwane, gdy przestają być pochlebne.
Każda strona witryny zawiera czasy Round-Trip z czterech hubów referencyjnych, aktualizowane w sposób ciągły. Liczby widoczne na stronach lokalizacji to mediany tych samych danych.
Subskrybuj, zanim będzie potrzebne
Kanał i e-mail na witrynę wymagają jednego adresu i około dziesięciu sekund. Robienie tego podczas incydentu jest możliwe i znacznie mniej przyjemne.