Operações

O que está quebrado, e desde quando

A página de status é alimentada pelas mesmas sondas que acordam o engenheiro de plantão. Não há etapa editorial entre uma verificação com falha e um painel vermelho, o que é deliberado e ocasionalmente constrangedor.

Frota
uptime de 12 meses99.993%
Meta de SLA99.99%
locais34
Incidentes em aberto0
Todos os sistemas operacionais
Europe
North America
MIA-01 Miami100.000%
Latin America
Asia-Pacific
Middle East & Africa

90 dias · Os números de latência são medianas medidas de nossas próprias sondas, não folhetos de fornecedores. Eles mudam; a página atualiza quando isso acontece.

01

O que a página mostra

As sondas são executadas a cada 30 segundos de fora da nossa própria rede. O histórico fica disponível por 90 dias.

01

Por site, não por frota

Todos os 34 sites são listados separadamente. Um problema em uma cidade não contamina as outras, porque um número de disponibilidade agregado esconde exatamente a interrupção que você veio procurar nesta página.

02

Seis componentes por site

Rede, hipervisor, armazenamento, provisionamento, painel e API, cada um verificado de forma independente. Uma fila de provisionamento congestionada, portanto, não faz parecer que suas instâncias em execução estão fora do ar.

03

Medido de fora

As sondas ficam em redes que não operamos, em várias regiões, e uma verificação precisa falhar em mais de uma antes que qualquer coisa mude de cor. Monitorar uma rede de dentro dela mede muito pouco.

04

O mesmo número de disponibilidade do SLA

99,993% nos últimos 12 meses, calculado a partir dessas sondas em vez de uma definição mais amigável. O tempo de inatividade conta a partir da primeira verificação que falhou, não a partir do momento em que alguém reconheceu o problema.

05

Notas pós-incidente

Qualquer coisa classificada como P1 ou P2 recebe um relatório por escrito em até 5 dias úteis: o que quebrou, o que foi feito, o que mudou depois. Eles são entediantes de propósito e nunca são silenciosamente apagados.

02

Como os incidentes são classificados

Quatro níveis, atribuídos pelo engenheiro de plantão em poucos minutos e revisados para cima sem hesitação quando o quadro muda. Nada é reclassificado para baixo depois para fazer um relatório parecer melhor.

NívelSignificadoPrimeira atualizaçãoDepois
P1Instâncias de clientes fora do ar ou inacessíveis em um site, ou uma falha afetando mais de um site.Em até 15 minutosA cada 30 minutos até a resolução
P2Degradação severa. Perda de pacotes, latência de armazenamento ou um componente fora do ar enquanto as instâncias continuam servindo.Em até 30 minutosA cada hora
P3Falha no plano de controle. Provisionamento, painel, API ou cobrança indisponíveis enquanto as instâncias em execução não são afetadas.Em até 2 horasDuas vezes ao dia
P4Cosmético ou de instância única. Um item preso na fila, um gráfico errado, um nó degradado com um reserva a quente já assumindo.No próximo dia útilNa resolução

Uma única instância de cliente com falha é um P4 nesta página e um ticket com tempo de resposta mediano de 11 minutos no painel. O nível descreve o raio de impacto, não o quanto isso importa para você.

03

Manutenção

A manutenção planejada é anunciada com pelo menos 7 dias de antecedência, por e-mail para as contas afetadas e na página de status. Revendedores recebem 14 dias. Cada aviso nomeia o site, a janela, o impacto esperado e se envolve ou não uma reinicialização.

As janelas ocorrem das 01:00 às 05:00 no horário local do site, que é a única escolha razoável quando a frota abrange 29 países e alguém está sempre acordado. A maior parte do trabalho termina na primeira hora.

Onde uma carga de trabalho pode ser migrada ao vivo, ela é, e o efeito visível é alguns segundos de latência adicional em vez de uma reinicialização. Trabalho de firmware, kernel e hipervisor não pode ser feito dessa forma, e o aviso diz isso claramente em vez de esconder uma reinicialização atrás da palavra “breve”.

01

Manutenção de emergência

Anunciada assim que é decidida, às vezes com menos de uma hora de antecedência. Reservada para uma correção de segurança sob exploração ativa ou hardware que vai falhar de qualquer jeito.

02

Adiamentos

Um por instância por trimestre, por ticket, com até 14 dias. Além disso, o nó precisa ser feito, e vamos ajudá-lo a planejar em torno da data em vez de movê-la novamente.

03

O que nunca acontece em uma janela

Mudanças de preço, mudanças de política e qualquer coisa que envolva seus dados. A manutenção cobre hardware e software que operamos, nunca o conteúdo de seus discos.

04

Como ser avisado

Quatro formas de assinar. Nenhuma exige conta, e nenhuma será usada para enviar qualquer coisa além de incidentes.

01

Feed Atom

Um feed para tudo, ou um por site. É a opção que continua funcionando quando o e-mail não funciona, o que durante um incidente de rede é exatamente a situação em que você se encontra.

02

E-mail por site

Assine um endereço para as cidades que você usa. Clientes são assinados automaticamente para seus próprios sites e podem desativar, embora preferíssemos que não o fizessem.

03

Webhooks

Um POST assinado em cada mudança de estado, para qualquer um que roteie incidentes para suas próprias ferramentas. Mesmo formato de payload da API, com novas tentativas com backoff por 24 horas.

04

API de status

Um endpoint público somente leitura que retorna estado atual e incidentes abertos como JSON. Sem token necessário, limitado educadamente, e inalterado desde 2024.

Esse é o único uso do endereço. Não há newsletter, mala de anúncios de produto, nem lista de marketing na qual uma assinatura de status silenciosamente o inscreva.

05

Perguntas sobre status

Porque ela monitora sites e componentes, não instâncias individuais. Um nó ou uma instância é um ticket, não um incidente público, e o ticket é de longe o caminho mais rápido para uma correção.

Deliberadamente não na infraestrutura que ela monitora. Ela é servida de um site separado com trânsito separado, para que uma falha de rede não derrube a página que descreve essa falha.

Janelas anunciadas não contam contra o valor do SLA. Todo o resto conta, incluindo as interrupções que foram culpa nossa e as que foram de terceiros.

Noventa dias na própria página, e indefinidamente para relatos de P1 e P2. Incidentes antigos não são removidos quando deixam de ser lisonjeiros.

Cada página de site traz tempos de ida e volta de probes dos quatro hubs de referência, atualizados continuamente. Os números impressos nas páginas de localização são medianas desses mesmos dados.

Pronto quando você estiver

Assine antes de precisar

O feed e o e-mail por site levam um endereço e cerca de dez segundos. Fazer isso durante um incidente é possível e consideravelmente menos agradável.