MTTR、MTBF、MTTD

MTTR(平均修复时间)衡量从发现到恢复的时长,是 SLA 与复盘紧盯之物。MTBF(平均无故障时间)衡量多久坏一次,靠更好的硬件与更早的干预来提高。MTTD(平均检测时间)衡量故障多久没人发现,是漫长 MTTR 里的隐形杀手。可用性 = MTBF ÷(MTBF + MTTR),扳动任一杠杆,可用性随之而动。

MTTR 的大头花在找而非修

把一次故障的时间线拆开,修复本身通常只要几分钟——换盘、重启、切换。小时数耗在这之前的一切:注意到故障、在五套系统里找出真正出事的那套、定位设备、确认改了什么。所以 MTTR 最大的收益来自上下文而非手速:部件级早期预警(把 MTTD 压到近零)、按拓扑关联并按业务影响排序的告警、能准确说出设备是什么在哪里的资产记录、以及立即可动手的带外访问。

常见问题

MTTR 是 Mean Time To Repair(平均修复时间)——从故障发生到服务恢复的平均时长。MTTR = 总停机时长 ÷ 故障次数,按业务与故障类型分别跟踪。降低 MTTR 的方法:拆解组成、部件级遥测(更快发现)、准确资产和拓扑关联(更快定位)、远程访问和运行手册(更快修复)。MTTR 的大头藏在定位,而非修复。