SRE 的定义

SRE(Site Reliability Engineering,站点可靠性工程)是 Google 在 2003 年提出并实践的一种将软件工程方法应用于 IT 运维的 discipline。SRE 的核心命题是:如何用自动化和工程化手段,在业务快速增长的同时,保持服务的可靠性。

SRE 核心实践

SRE 的关键实践包括:

  • SLO(服务目标):为每个服务定义可接受的不可用预算,例如 99.9% 可用率意味着每月最多 43 分钟停机
  • 错误预算:当错误预算耗尽时,所有非紧急变更冻结,直到可靠性恢复
  • 自动化:将重复性操作转化为代码,减少人为失误
  • 无免责复盘(Blameless Postmortem):事故后关注系统缺陷而非个人失误
  • 按需容量规划:基于真实流量曲线而非峰值估算采购资源

物理基础设施在 SRE 中的角色

传统 SRE 讨论多聚焦在软件层面——代码部署、配置管理、容量规划——但物理基础设施的故障往往占数据中心停机的 30-50%。服务器电源故障、PDU 过载、机房制冷失效、交换机光模块损坏,这些硬件层事件同样消耗错误预算。云新 DCOS 平台将物理层遥测(BMC 事件、PDU 功率、温湿度)接入 SRE 监控管道,让 SRE 团队对从芯片到机柜的完整可用性负责。