SRE 与运维治理

迁移入口

当前规范入口为 SRE 与运维治理;本页保留以兼容既有链接和早期分类。

把“系统是否可靠”转成可观察、可协作、可复盘的工作方式。

可靠性目标

  • SLI:可量化的可用性、延迟、错误率、吞吐量、数据正确性与新鲜度。
  • SLO:目标值、统计窗口、分层服务目标与例外说明。
  • 预算与取舍:当可靠性预算消耗时,如何影响发布、容量和工程优先级。

治理与事件

  • 运维治理:服务边界、责任人、变更、值班、升级和复盘机制。
  • 事件管理:发现、分级、指挥、沟通、缓解、恢复与复盘。
  • 复盘文化:记录事实和证据,区分判断、动作、结果与未确认假设。

Map 路线

可靠性目标 → 告警与指标 → 可观测性与应急 → Incident → HowTo → SLO 复审。

待补卡片

  • Concept:SLI、SLO、错误预算的边界。
  • Reference:事件等级、升级路径和服务目录字段。
  • HowTo:建立一次事件复盘到行动项验收的闭环。

返回 运维知识库总图