Vận hành

Cái gì hỏng, và từ khi nào

Trang trạng thái được cấp dữ liệu bởi cùng các probe đánh thức kỹ sư trực. Không có bước biên tập nào nằm giữa một kiểm tra thất bại và bảng đỏ, điều này có chủ đích và đôi khi gây xấu hổ.

Hạ tầng
uptime 12 tháng99.993%
Mục tiêu SLA99.99%
vị trí34
Sự cố đang mở0
Tất cả hệ thống hoạt động bình thường
Europe
North America
MIA-01 Miami100.000%
Latin America
Asia-Pacific
Middle East & Africa

90 ngày · Số liệu độ trễ là trung vị đo được từ các cảm biến của chúng tôi, không phải từ tài liệu tiếp thị của nhà cung cấp. Chúng thay đổi; trang cập nhật khi chúng thay đổi.

01

Trang này hiển thị gì

Probe chạy mỗi 30 giây từ bên ngoài mạng của chúng tôi. Lịch sử được giữ trong 90 ngày.

01

Theo từng site, không theo toàn bộ hạ tầng

Tất cả 34 site được liệt kê riêng. Sự cố tại một thành phố không ảnh hưởng đến các nơi khác, vì một con số uptime tổng hợp sẽ che giấu chính xác sự gián đoạn mà bạn đến trang này để xem.

02

Sáu thành phần cho mỗi site

Mạng, hypervisor, lưu trữ, cấp phát, bảng điều khiển và API, mỗi thành phần được kiểm tra độc lập. Một hàng đợi cấp phát bị tồn đọng không có nghĩa là các instance đang chạy của bạn bị down.

03

Đo từ bên ngoài

Các probe nằm trên các mạng mà chúng tôi không vận hành, ở nhiều khu vực, và một kiểm tra phải thất bại từ nhiều nơi trước khi mọi thứ đổi màu. Giám sát một mạng từ bên trong nó phản ánh rất ít.

04

Cùng con số uptime như trong SLA

99.993% trong 12 tháng gần nhất, được tính từ các probe này thay vì từ một định nghĩa dễ tính hơn. Thời gian downtime được tính từ lần kiểm tra thất bại đầu tiên, không phải từ lúc ai đó xác nhận sự cố.

05

Ghi chú sau sự cố

Bất kỳ sự cố nào được xếp hạng P1 hoặc P2 đều có bài viết tường thuật trong vòng 5 ngày làm việc: cái gì hỏng, đã làm gì, và cái gì thay đổi sau đó. Chúng được viết một cách khô khan có chủ đích và không bao giờ bị âm thầm xóa.

02

Cách phân loại sự cố

Bốn mức độ, được kỹ sư trực chỉ định trong vài phút và được nâng cấp ngay lập tức khi tình hình thay đổi. Không có gì bị hạ cấp sau đó để làm báo cáo đẹp hơn.

Mức độÝ nghĩaCập nhật đầu tiênSau đó
P1Instance của khách hàng bị down hoặc không truy cập được tại một site, hoặc sự cố ảnh hưởng đến nhiều hơn một site.Trong vòng 15 phútMỗi 30 phút cho đến khi khắc phục xong
P2Suy giảm nghiêm trọng. Mất gói tin, độ trễ lưu trữ, hoặc một thành phần bị down trong khi các instance vẫn phục vụ.Trong vòng 30 phútMỗi giờ
P3Sự cố mặt điều khiển. Cấp phát, bảng điều khiển, API hoặc thanh toán không khả dụng trong khi các instance đang chạy không bị ảnh hưởng.Trong vòng 2 giờHai lần mỗi ngày
P4Lỗi thẩm mỹ hoặc một instance đơn lẻ. Một mục tồn đọng, một đồ thị sai, một node suy giảm nhưng có hot spare đã thay thế.Ngày làm việc tiếp theoKhi khắc phục xong

Một instance khách hàng gặp sự cố là P4 trên trang này và là một ticket với thời gian phản hồi trung bình 11 phút trong bảng điều khiển. Cấp độ mô tả phạm vi ảnh hưởng thay vì mức độ quan trọng đối với bạn.

03

Bảo trì

Bảo trì theo kế hoạch được công bố ít nhất 7 ngày trước, qua email đến các tài khoản bị ảnh hưởng và trên trang trạng thái. Nhà phân phối được 14 ngày. Mỗi thông báo nêu rõ tên site, thời gian, ảnh hưởng dự kiến và có cần khởi động lại hay không.

Các cửa sổ bảo trì chạy từ 01:00 đến 05:00 giờ địa phương tại site, đây là lựa chọn hợp lý duy nhất khi hạ tầng trải rộng 29 quốc gia và ai đó luôn thức. Hầu hết công việc hoàn tất trong giờ đầu tiên.

Nếu một khối lượng công việc có thể di trú trực tiếp (live-migrate) thì sẽ được thực hiện, và ảnh hưởng thấy rõ chỉ là vài giây độ trễ thêm thay vì khởi động lại. Việc nâng cấp firmware, kernel và hypervisor không thể làm theo cách đó, và thông báo nói rõ điều đó thay vì giấu một lần khởi động sau từ “ngắn gọn”.

01

Bảo trì khẩn cấp

Được công bố ngay khi có quyết định, đôi khi chỉ báo trước dưới một giờ. Dành cho bản vá bảo mật đang bị khai thác tích cực, hoặc phần cứng sắp hỏng trong mọi trường hợp.

02

Hoãn lại

Một lần cho mỗi instance mỗi quý, qua ticket, có thể hoãn tối đa 14 ngày. Sau đó node phải được bảo trì, và chúng tôi sẽ giúp bạn lên kế hoạch xung quanh ngày đó thay vì tiếp tục dời.

03

Điều không bao giờ xảy ra trong một cửa sổ bảo trì

Thay đổi giá, thay đổi chính sách và bất cứ điều gì đụng đến dữ liệu của bạn. Bảo trì bao gồm phần cứng và phần mềm chúng tôi vận hành, không bao giờ bao gồm nội dung trên đĩa của bạn.

04

Được thông báo về sự cố

Bốn cách để đăng ký. Không cách nào yêu cầu tài khoản, và không cách nào sẽ được dùng để gửi cho bạn bất cứ thứ gì ngoài thông báo sự cố.

01

Nguồn cấp Atom

Một nguồn cấp cho tất cả, hoặc một nguồn cấp cho mỗi trang web. Đây là lựa chọn vẫn hoạt động khi email không hoạt động, đó chính xác là tình huống bạn gặp phải trong sự cố mạng.

02

Email theo từng trang web

Đăng ký một địa chỉ cho các thành phố bạn sử dụng. Khách hàng tự động đăng ký cho trang web của họ và có thể tắt, mặc dù chúng tôi mong bạn không nên.

03

Webhooks

Một POST đã ký cho mỗi thay đổi trạng thái, dành cho ai muốn định tuyến sự cố vào công cụ riêng của họ. Cấu trúc payload giống API, được thử lại với backoff trong 24 giờ.

04

API trạng thái

Một endpoint công khai chỉ đọc trả về trạng thái hiện tại và các sự cố đang mở dưới dạng JSON. Không cần token, giới hạn tốc độ hợp lý, và không thay đổi kể từ 2024.

Đó là toàn bộ mục đích sử dụng của địa chỉ này. Không có bản tin, không có email thông báo sản phẩm, và không có danh sách tiếp thị nào mà việc đăng ký trạng thái âm thầm đưa bạn vào.

05

Câu hỏi về trạng thái

Vì nó theo dõi các trang web và thành phần, không phải các máy chủ riêng lẻ. Một node hoặc một server lỗi là một ticket, không phải sự cố công khai, và ticket là cách nhanh hơn nhiều để giải quyết.

Cố ý không nằm trên hạ tầng mà nó theo dõi. Nó được phục vụ từ một trang web riêng với đường truyền riêng, để một sự cố mạng không thể làm sập trang mô tả sự cố đó.

Các cửa sổ bảo trì đã thông báo không tính vào chỉ số SLA. Mọi thứ khác đều được tính, bao gồm cả sự cố do lỗi của chúng tôi và do lỗi của người khác.

Chín mươi ngày trên trang, và vô thời hạn cho các bài viết về sự cố P1 và P2. Các sự cố cũ không bị xóa khi chúng không còn tốt đẹp.

Mỗi trang web có thời gian khứ hồi của các probe từ bốn trung tâm tham chiếu, cập nhật liên tục. Các con số in trên trang vị trí là giá trị trung bình của cùng dữ liệu đó.

Sẵn sàng khi bạn cần

Đăng ký trước khi bạn cần

Nguồn cấp và email theo trang cần một địa chỉ và khoảng mười giây. Thực hiện trong lúc sự cố là có thể nhưng kém dễ chịu hơn nhiều.