SRE 与运维治理
把“系统是否可靠”转成可观察、可协作、可复盘的工作方式。
可靠性目标
- SLI:可量化的可用性、延迟、错误率、吞吐量、数据正确性与新鲜度。
- SLO:目标值、统计窗口、分层服务目标与例外说明。
- 预算与取舍:当可靠性预算消耗时,如何影响发布、容量和工程优先级。
治理与事件
- 运维治理:服务边界、责任人、变更、值班、升级和复盘机制。
- 事件管理:发现、分级、指挥、沟通、缓解、恢复与复盘。
- 复盘文化:记录事实和证据,区分判断、动作、结果与未确认假设。
Map 路线
可靠性目标 → 告警与指标 → 可观测性与应急 → Incident → HowTo → SLO 复审。
待补卡片
Concept:SLI、SLO、错误预算的边界。Reference:事件等级、升级路径和服务目录字段。HowTo:建立一次事件复盘到行动项验收的闭环。
返回 运维知识库总图。