Операции

Что сломано и с каких пор

Страница статуса питается от тех же проб, которые будят дежурного инженера. Между неудачной проверкой и красной панелью нет никакого редакционного шага — это намеренно и иногда неловко.

Флот
uptime за 12 месяцев99.993%
Целевой SLA99.99%
площадки34
Открытые инциденты0
Все системы работают штатно
Europe
North America
MIA-01 Miami100.000%
Latin America
Asia-Pacific
Middle East & Africa

90 дней · Значения задержки — это измеренные медианы с наших собственных зондов, а не данные из маркетинговых брошюр. Они меняются; страница обновляется, когда они меняются.

00

Журнал

Инженерный дневник. По инцидентам — разбор с реальными отметками времени, по решениям о железе — цифры, которые на них повлияли, по изменениям политик — объяснение причин, даже если из-за этого мы выглядим медлительными. Здесь нет ни одной строчки от маркетинга, что становится очевидно в течение пары абзацев.

01

Что показывает страница

Пробы запускаются каждые 30 секунд извне нашей сети. История хранится в течение 90 дней.

01

Per site, not per fleet

All 34 sites are listed separately. A problem in one city does not colour the others, because an aggregate availability figure hides exactly the outage you came to the page about.

02

Six components per site

Network, hypervisor, storage, provisioning, panel and API, each checked independently. A provisioning queue backing up therefore does not claim that your running instances are down.

03

Measured from outside

Probes sit on networks we do not operate, in several regions, and a check has to fail from more than one before anything changes colour. Monitoring a network from inside it measures very little.

04

The same uptime figure as the SLA

99.993% across the last 12 rolling months, calculated from these probes rather than from a friendlier definition. Downtime counts from the first failed check, not from the moment somebody acknowledged it.

05

Post-incident notes

Anything graded P1 or P2 gets a written follow-up within 5 working days: what broke, what was done, what changed afterwards. They are dull on purpose and they are never quietly deleted.

02

How incidents are graded

Four levels, assigned by the on-call engineer within minutes and revised upward without hesitation when the picture changes. Nothing is graded down afterwards to make a report read better.

LevelMeaningFirst updateThen
P1Customer instances down or unreachable at a site, or a fault touching more than one site.Within 15 minutesEvery 30 minutes until resolved
P2Severe degradation. Packet loss, storage latency, or a component down while instances keep serving.Within 30 minutesHourly
P3Control-plane fault. Provisioning, the panel, the API or billing unavailable while running instances are unaffected.Within 2 hoursTwice a day
P4Cosmetic or single-instance. A stuck queue item, a wrong graph, one node degraded with a hot spare already carrying it.Next working dayOn resolution

A single customer instance failing is a P4 on this page and a ticket with an 11-minute median response in the panel. The grade describes blast radius rather than how much it matters to you.

03

Maintenance

Planned maintenance is announced at least 7 days ahead, by mail to the affected accounts and on the status page. Resellers get 14 days. Every notice names the site, the window, the expected impact and whether a reboot is involved.

Windows run from 01:00 to 05:00 local time at the site, which is the only reasonable choice when the fleet spans 29 countries and somebody is always awake. Most work finishes inside the first hour.

Where a workload can be live-migrated it is, and the visible effect is a few seconds of additional latency rather than a restart. Firmware, kernel and hypervisor work cannot be done that way, and the notice says so plainly instead of hiding a reboot behind the word “brief”.

01

Emergency maintenance

Announced as soon as it is decided, sometimes with under an hour of notice. Reserved for a security fix under active exploitation, or hardware that is going to fail either way.

02

Deferrals

One per instance per quarter, by ticket, up to 14 days. Beyond that the node has to be done, and we will help you plan around the date rather than move it again.

03

Что никогда не происходит в окне

Изменения цен, условий, а также всё, что касается ваших данных. Обслуживание охватывает аппаратное и программное обеспечение, которое мы эксплуатируем, но никогда не содержимое ваших дисков.

04

Как вы узнаете об этом

Четыре способа подписки. Ни один из них не требует аккаунта, и ни один никогда не будет использован для рассылки чего-либо, кроме инцидентов.

01

Atom-лента

Одна лента для всего или по одной на площадку. Это вариант, который продолжает работать, когда почта не работает, а во время сетевого инцидента это именно та ситуация, в которой вы находитесь.

02

Почта по площадкам

Подпишите адрес на города, которые вы используете. Клиенты подписываются автоматически на свои площадки и могут отключить это, хотя мы предпочли бы, чтобы вы этого не делали.

03

Вебхуки

Подписанный POST при каждом изменении состояния для тех, кто маршрутизирует инциденты в свои инструменты. Та же структура данных, что и в API, повторные попытки с возрастающей задержкой в течение 24 часов.

04

API статуса

Публичная read-only конечная точка, возвращающая текущее состояние и открытые инциденты в формате JSON. Без токена, вежливое ограничение частоты запросов, не меняется с 2024 года.

Это всё использование адреса. Никакой рассылки новостей, никакого списка анонсов продуктов и никакого маркетингового списка, в который вас молча записывает подписка на статус.

05

Вопросы о статусе

Потому что она отслеживает площадки и компоненты, а не отдельные инстансы. Один узел или один инстанс — это тикет, а не публичный инцидент, и тикет — гораздо более быстрый путь к исправлению.

Сознательно не на той инфраструктуре, за которой она следит. Она обслуживается с отдельной площадки с отдельным транзитом, поэтому сетевая авария не может повалить страницу, описывающую эту аварию.

Анонсированные окна не учитываются в показателе SLA. Всё остальное учитывается, включая сбои по нашей вине и те, что по вине кого-то ещё.

Девяносто дней на самой странице и бессрочно для описаний P1 и P2. Старые инциденты не удаляются, когда перестают быть лестными.

На странице каждой площадки приводятся времена прохождения пробных запросов от четырёх опорных хабов, обновляемые непрерывно. Цифры на страницах локаций — медианы тех же данных.

Готовы, когда вы готовы

Подпишитесь до того, как понадобится

Лента и почта по площадкам требуют один адрес и около десяти секунд. Делать это во время инцидента возможно, но заметно менее приятно.