正常运行时间 vs 停机时间:含义与度量
正常运行时间是系统可用并履职的时间;停机时间则是它无法履职的时间。二者共同描述可用性——绝大部分服务级别协议(SLA)都建立在这个数字之上。
99.9%
三个九
每年约8.8小时停机
99.99%
四个九
每年约52分钟
99.999%
五个九
每年约5分钟
99.9999%
六个九
每年约32秒
正常运行时间如何计算
正常运行时间 % =(总时间 − 停机时间)÷ 总时间 × 100
MTBF(平均无故障时间)衡量多久坏一次;MTTR(平均修复时间)衡量恢复得多快。提升可用性,就要提高MTBF、缩短MTTR。
多数停机始于物理层
业务中断通常在应用层被上报,但往往起源于其下:一块故障的电源、一个劣化的RAID阵列、一个过热的机柜、一条抖动的光链路,或一次无人记录的配置变更。只看操作系统的监控发现得晚——往往在故障发生的那一刻,而这恰恰是MTTR飙升之时。
因此,降低停机在很大程度上关乎在硬件层更早发现、更快恢复:部件级早期预警、系统宕机时的带外救援通道、加速诊断的准确资产数据,以及从部件故障到其所威胁业务服务的清晰链路。
云新如何守护可用性
常见问题
Uptime与Downtime有何区别?
Uptime(正常运行时间)是系统可用并正常工作的时间;Downtime(停机时间)是它不可用的时间,无论源于故障、依赖还是计划维护。二者是可用性这一度量的两面。
正常运行时间如何计算?
正常运行时间百分比=(总时间-停机时间)÷总时间×100。例如一年中停机8小时,约为99.91%的正常运行时间。
可用性的"几个九"是什么意思?
"几个九"描述正常运行时间目标。三个九(99.9%)每年约允许8.8小时停机,四个九(99.99%)约52分钟,五个九(99.999%)约5分钟。
