Cái gì hỏng, và từ khi nào
Trang trạng thái được cấp dữ liệu bởi cùng các probe đánh thức kỹ sư trực. Không có bước biên tập nào nằm giữa một kiểm tra thất bại và bảng đỏ, điều này có chủ đích và đôi khi gây xấu hổ.
90 ngày · Số liệu độ trễ là trung vị đo được từ các cảm biến của chúng tôi, không phải từ tài liệu tiếp thị của nhà cung cấp. Chúng thay đổi; trang cập nhật khi chúng thay đổi.
Nhật ký
Một cuốn nhật ký kỹ thuật. Sự cố có bài viết hậu kiểm với mốc thời gian thực, quyết định phần cứng có số liệu làm cơ sở, và thay đổi chính sách có lý do ngay cả khi lý do làm chúng tôi trông chậm chạp. Không có gì ở đây do bộ phận marketing viết, điều đó trở nên rõ ràng ngay trong một đoạn văn.
Trang này hiển thị gì
Probe chạy mỗi 30 giây từ bên ngoài mạng của chúng tôi. Lịch sử được giữ trong 90 ngày.
Theo từng site, không theo toàn bộ hạ tầng
Tất cả 34 site được liệt kê riêng. Sự cố tại một thành phố không ảnh hưởng đến các nơi khác, vì một con số uptime tổng hợp sẽ che giấu chính xác sự gián đoạn mà bạn đến trang này để xem.
Sáu thành phần cho mỗi site
Mạng, hypervisor, lưu trữ, cấp phát, bảng điều khiển và API, mỗi thành phần được kiểm tra độc lập. Một hàng đợi cấp phát bị tồn đọng không có nghĩa là các instance đang chạy của bạn bị down.
Đo từ bên ngoài
Các probe nằm trên các mạng mà chúng tôi không vận hành, ở nhiều khu vực, và một kiểm tra phải thất bại từ nhiều nơi trước khi mọi thứ đổi màu. Giám sát một mạng từ bên trong nó phản ánh rất ít.
Cùng con số uptime như trong SLA
99.993% trong 12 tháng gần nhất, được tính từ các probe này thay vì từ một định nghĩa dễ tính hơn. Thời gian downtime được tính từ lần kiểm tra thất bại đầu tiên, không phải từ lúc ai đó xác nhận sự cố.
Ghi chú sau sự cố
Bất kỳ sự cố nào được xếp hạng P1 hoặc P2 đều có bài viết tường thuật trong vòng 5 ngày làm việc: cái gì hỏng, đã làm gì, và cái gì thay đổi sau đó. Chúng được viết một cách khô khan có chủ đích và không bao giờ bị âm thầm xóa.
Cách phân loại sự cố
Bốn mức độ, được kỹ sư trực chỉ định trong vài phút và được nâng cấp ngay lập tức khi tình hình thay đổi. Không có gì bị hạ cấp sau đó để làm báo cáo đẹp hơn.
| Mức độ | Ý nghĩa | Cập nhật đầu tiên | Sau đó |
|---|---|---|---|
| P1 | Instance của khách hàng bị down hoặc không truy cập được tại một site, hoặc sự cố ảnh hưởng đến nhiều hơn một site. | Trong vòng 15 phút | Mỗi 30 phút cho đến khi khắc phục xong |
| P2 | Suy giảm nghiêm trọng. Mất gói tin, độ trễ lưu trữ, hoặc một thành phần bị down trong khi các instance vẫn phục vụ. | Trong vòng 30 phút | Mỗi giờ |
| P3 | Sự cố mặt điều khiển. Cấp phát, bảng điều khiển, API hoặc thanh toán không khả dụng trong khi các instance đang chạy không bị ảnh hưởng. | Trong vòng 2 giờ | Hai lần mỗi ngày |
| P4 | Lỗi thẩm mỹ hoặc một instance đơn lẻ. Một mục tồn đọng, một đồ thị sai, một node suy giảm nhưng có hot spare đã thay thế. | Ngày làm việc tiếp theo | Khi khắc phục xong |
Một instance khách hàng gặp sự cố là P4 trên trang này và là một ticket với thời gian phản hồi trung bình 11 phút trong bảng điều khiển. Cấp độ mô tả phạm vi ảnh hưởng thay vì mức độ quan trọng đối với bạn.
Bảo trì
Bảo trì theo kế hoạch được công bố ít nhất 7 ngày trước, qua email đến các tài khoản bị ảnh hưởng và trên trang trạng thái. Nhà phân phối được 14 ngày. Mỗi thông báo nêu rõ tên site, thời gian, ảnh hưởng dự kiến và có cần khởi động lại hay không.
Các cửa sổ bảo trì chạy từ 01:00 đến 05:00 giờ địa phương tại site, đây là lựa chọn hợp lý duy nhất khi hạ tầng trải rộng 29 quốc gia và ai đó luôn thức. Hầu hết công việc hoàn tất trong giờ đầu tiên.
Nếu một khối lượng công việc có thể di trú trực tiếp (live-migrate) thì sẽ được thực hiện, và ảnh hưởng thấy rõ chỉ là vài giây độ trễ thêm thay vì khởi động lại. Việc nâng cấp firmware, kernel và hypervisor không thể làm theo cách đó, và thông báo nói rõ điều đó thay vì giấu một lần khởi động sau từ “ngắn gọn”.
Bảo trì khẩn cấp
Được công bố ngay khi có quyết định, đôi khi chỉ báo trước dưới một giờ. Dành cho bản vá bảo mật đang bị khai thác tích cực, hoặc phần cứng sắp hỏng trong mọi trường hợp.
Hoãn lại
Một lần cho mỗi instance mỗi quý, qua ticket, có thể hoãn tối đa 14 ngày. Sau đó node phải được bảo trì, và chúng tôi sẽ giúp bạn lên kế hoạch xung quanh ngày đó thay vì tiếp tục dời.
Điều không bao giờ xảy ra trong một cửa sổ bảo trì
Thay đổi giá, thay đổi chính sách và bất cứ điều gì đụng đến dữ liệu của bạn. Bảo trì bao gồm phần cứng và phần mềm chúng tôi vận hành, không bao giờ bao gồm nội dung trên đĩa của bạn.
Được thông báo về sự cố
Bốn cách để đăng ký. Không cách nào yêu cầu tài khoản, và không cách nào sẽ được dùng để gửi cho bạn bất cứ thứ gì ngoài thông báo sự cố.
Nguồn cấp Atom
Một nguồn cấp cho tất cả, hoặc một nguồn cấp cho mỗi trang web. Đây là lựa chọn vẫn hoạt động khi email không hoạt động, đó chính xác là tình huống bạn gặp phải trong sự cố mạng.
Email theo từng trang web
Đăng ký một địa chỉ cho các thành phố bạn sử dụng. Khách hàng tự động đăng ký cho trang web của họ và có thể tắt, mặc dù chúng tôi mong bạn không nên.
Webhooks
Một POST đã ký cho mỗi thay đổi trạng thái, dành cho ai muốn định tuyến sự cố vào công cụ riêng của họ. Cấu trúc payload giống API, được thử lại với backoff trong 24 giờ.
API trạng thái
Một endpoint công khai chỉ đọc trả về trạng thái hiện tại và các sự cố đang mở dưới dạng JSON. Không cần token, giới hạn tốc độ hợp lý, và không thay đổi kể từ 2024.
Đó là toàn bộ mục đích sử dụng của địa chỉ này. Không có bản tin, không có email thông báo sản phẩm, và không có danh sách tiếp thị nào mà việc đăng ký trạng thái âm thầm đưa bạn vào.
Câu hỏi về trạng thái
Vì nó theo dõi các trang web và thành phần, không phải các máy chủ riêng lẻ. Một node hoặc một server lỗi là một ticket, không phải sự cố công khai, và ticket là cách nhanh hơn nhiều để giải quyết.
Cố ý không nằm trên hạ tầng mà nó theo dõi. Nó được phục vụ từ một trang web riêng với đường truyền riêng, để một sự cố mạng không thể làm sập trang mô tả sự cố đó.
Các cửa sổ bảo trì đã thông báo không tính vào chỉ số SLA. Mọi thứ khác đều được tính, bao gồm cả sự cố do lỗi của chúng tôi và do lỗi của người khác.
Chín mươi ngày trên trang, và vô thời hạn cho các bài viết về sự cố P1 và P2. Các sự cố cũ không bị xóa khi chúng không còn tốt đẹp.
Mỗi trang web có thời gian khứ hồi của các probe từ bốn trung tâm tham chiếu, cập nhật liên tục. Các con số in trên trang vị trí là giá trị trung bình của cùng dữ liệu đó.
Đăng ký trước khi bạn cần
Nguồn cấp và email theo trang cần một địa chỉ và khoảng mười giây. Thực hiện trong lúc sự cố là có thể nhưng kém dễ chịu hơn nhiều.