什么坏了,从什么时候开始
状态页面由唤醒值班工程师的相同探针提供数据。失败的检查和红色面板之间没有编辑步骤,这是故意的,偶尔也会让人尴尬。
90 天 · 延迟数据来自我们自己探针的测量中位数,而非供应商手册。它们会变化;页面会随之更新。
日志
工程日记。事件会有带真实时间戳的事后分析,硬件决策会列出依据的数据,政策变更会说明理由——即使这些理由让我们看起来反应迟缓。这里的每一篇都不是市场部门写的,这一点读一段就能看出来。
页面显示什么
探针每 30 秒从我们网络外部运行一次。历史记录保留 90 天。
按站点而非按池
所有34个站点均单独列出。一个城市的问题不会影响其他城市,因为总体的可用性数字恰恰掩盖了你来到此页面想了解的故障。
每个站点六个组件
网络、虚拟机监控程序、存储、预配置、面板和API,各自独立检查。因此,预配置队列积压并不意味着你正在运行的实例宕机。
从外部测量
探测点位于我们不运营的网络上,分布在多个区域,并且一项检查必须从多个位置失败后,状态才会改变。从网络内部监控网络能测出的东西很少。
与SLA相同的可用性数字
过去12个月滚动计算的99.993%,由这些探测点计算得出,而非采用更宽松的定义。宕机时间从第一次检测失败时开始计算,而非从有人确认时开始。
事后说明
任何分级为P1或P2的事件都会在5个工作日内得到书面后续说明:出了什么问题、做了什么、之后发生了什么变化。这些说明故意写得平淡,且绝不会被悄悄删除。
事件分级方式
四个级别,由值班工程师在几分钟内分配,并在情况变化时毫不犹豫地向上调整。之后不会为了报告更好看而降级。
| 级别 | 含义 | 首次更新 | 之后 |
|---|---|---|---|
| P1 | 客户实例在某个站点宕机或不可达,或故障影响多个站点。 | 15分钟内 | 每30分钟一次,直至解决 |
| P2 | 严重降级。丢包、存储延迟,或组件宕机但实例仍在服务。 | 30分钟内 | 每小时 |
| P3 | 控制平面故障。预配置、面板、API或计费不可用,但运行中的实例不受影响。 | 2小时内 | 每天两次 |
| P4 | 外观或单一实例问题。队列中卡住的项目、错误的图表、单个节点降级但有热备已承载。 | 下一个工作日 | 解决时 |
单个客户实例故障在本页面为P4,在面板中则是一张中位响应时间11分钟的工单。级别描述的是爆炸半径,而非对你而言有多重要。
维护
计划维护至少提前7天通过邮件通知受影响的账户并在状态页面公布。经销商为14天。每份通知均注明站点、窗口、预期影响以及是否涉及重启。
窗口为站点当地时间01:00至05:00,当服务器分布在29个国家、总有人在醒着时,这是唯一合理的选择。大部分工作在第一个小时内完成。
如果工作负载可以热迁移,则会进行热迁移,可见的影响是额外几秒延迟而非重启。固件、内核和虚拟机监控程序的工作无法如此进行,通知中会明确说明,而不是用“短暂”一词掩盖重启。
紧急维护
一旦决定立即公布,有时通知时间不足一小时。保留给正在被积极利用的安全修复或无论如何都会故障的硬件。
推迟
每个实例每季度一次,通过工单申请,最长14天。超过此期限节点必须完成维护,我们将帮助你围绕日期做计划,而不是再次推迟。
窗口中绝不会发生什么
价格变动、政策变更,以及任何触及您数据的事情。维护涵盖我们运营的硬件和软件,绝不涉及您磁盘上的内容。
如何获知
四种订阅方式。都不需要账户,也都绝不会用于向您发送除事件以外的任何内容。
Atom 源
一个源涵盖一切,或每个站点一个。这是在邮件失效时仍能正常工作的选项,而在网络事件期间,这正是您所处的情形。
按站点邮件
将地址订阅到您使用的城市。客户会自动订阅其自有站点,可以关闭,虽然我们希望您不要关闭。
Webhook
每次状态变更时发送带签名的 POST,供将事件路由到自身工具的用户使用。与 API 相同的负载格式,24 小时内带退避重试。
状态 API
公开的只读端点,以 JSON 返回当前状态和未关闭事件。无需令牌,礼貌限流,自 2024 年未变。
这就是该地址的全部用途。没有新闻通讯,没有产品通告邮件,也没有状态订阅会悄悄把您加入的营销列表。
状态常见问题
因为它跟踪的是站点和组件,而不是单个实例。一个节点或一个实例是工单,不是公开事件,而工单是更快的修复途径。
故意不托管在其监视的基础设施上。它由独立的站点和独立的传输提供服务,因此网络故障不会使描述该故障的页面失效。
已公布的时间窗口不计入 SLA 数值。其他一切均计入,包括我们自己造成的以及别人造成的中断。
页面本身保留九十天,而 P1 和 P2 事件报告则无限期保留。旧事件不会因为不再好看而被删除。
每个站点页面都带有来自四个参考枢纽的探测往返时间,持续更新。位置页面上显示的数值是这些数据的中位数。