来源快照|SRE与运维治理

本页是原图的只读导入快照,不是已核验文档。原有历史命令、版本标记与疑点保留;已识别口令替换为占位符。图片只保留引用。

  • SRE与运维治理 ^xm-8b94d7978b3248f392568ae539
    • ◆ 2026 深度扩展|SRE 与运维治理 ^xm-a202c44fb7b24d019ba5a3c9a9
      • 服务目录、所有权与依赖 ^xm-a9291c573fb6458e8a9fb0e4c8
        • 🎯 目标 ^xm-514a75f065ce4464955f95b1f1
          • 让每个服务都有负责人、用户、依赖、目标和应急入口。
        • 🧠 知识拆解 ^xm-b70134b19780484489265f59c7
          • 服务边界与关键用户旅程
          • owner/on-call/escalation
          • 上游/下游/数据依赖
          • 运行环境、版本与生命周期
          • Tier 分级与风险等级
        • ⌨️ 命令 / 配置 / 关键对象 ^xm-7c15e7f5a85146ce931b40c66a
          • 服务目录字段
          • CMDB/标签规范
          • 依赖图与数据流图
          • Runbook/Playbook 链接
        • 🔥 高频故障与风险 ^xm-f52e780ed9e14b44a7ba1f63e8
          • 服务无人负责
          • 依赖变更未通知
          • 资产与真实环境漂移
          • 告警找不到 owner
        • 🔎 排障路径 ^xm-5606247bfdb94ccd8ab246b931
          • 从用户路径反向画依赖
          • 核对仓库/流水线/集群标签
          • 抽样演练升级路径
        • 🧪 实战练习 ^xm-fdb15ce325024e32a1016e9767
          • 为一个真实系统建立服务目录
          • 从一次故障补齐缺失依赖
        • ✅ 验收标准 ^xm-30fdd5694f394b0eb9c097e3b3
          • 100% 关键服务有 owner
          • 依赖图可用于故障定位
          • 季度审阅与自动漂移检测
      • SLI、SLO、SLA 与错误预算 ^xm-9350fc4cec854ac982d2bcd219
        • 🎯 目标 ^xm-3951991cba814292a1af26e8db
          • 用用户感知的可靠性目标驱动告警和工程投入。
        • 🧠 知识拆解 ^xm-1ebc41f9c58e4b369a91cf82e9
          • 可用性/延迟/正确性/新鲜度 SLI
          • good events / valid events
          • 滚动窗口与自然月窗口
          • 多窗口多燃烧率
          • SLA、SLO 与内部目标差异
          • 错误预算策略
        • ⌨️ 命令 / 配置 / 关键对象 ^xm-a481028e354d4a88af4e682165
          • PromQL SLI
          • recording rules
          • SLO 文档
          • burn-rate alerts
        • 🔥 高频故障与风险 ^xm-8b44dcb7ef094f96b497648500
          • 只监控 CPU 不监控用户
          • SLO 过多不可维护
          • 窗口和分母错误
          • 错误预算没有决策动作
        • 🔎 排障路径 ^xm-5266b2f7e2ce495bbfd6363aee
          • 从用户旅程定义事件
          • 回放历史故障验证 SLI
          • 检查低流量与缺失数据
        • 🧪 实战练习 ^xm-cd81c515b7ae40aab53fcfbe74
          • 为 API 定义可用性与 p95 延迟 SLO
          • 根据 30 天目标设计快慢燃烧告警
        • ✅ 验收标准 ^xm-d503991517ff422c87f563149b
          • SLI 可自动计算
          • 告警能在预算耗尽前行动
          • SLO 评审包含产品与研发
        • 🔗 对应优秀开源项目 ^xm-09a5d578a41c4a74828fd6bf22
          • prometheus/prometheus

            备注(源图文本,未作运行验证):

            定位:指标采集、TSDB 与 PromQL
            源码阅读:discovery→scrape→WAL/TSDB→query→rules
            实战:四类黄金信号、recording rules、容量估算
            注意:控制标签基数,避免把日志字段当 label
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/prometheus/prometheus
          • prometheus/alertmanager

            备注(源图文本,未作运行验证):

            定位:告警分组、路由、抑制与静默
            源码阅读:grouping→routing→inhibition→receiver
            实战:按服务/严重级别路由并做抑制
            注意:告警必须可行动且有 owner/runbook
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/prometheus/alertmanager
      • On-call、事件指挥与沟通 ^xm-89c07d17bf2e4363b40d467e22
        • 🎯 目标 ^xm-92e2906a438844089292a18c4c
          • 在压力下用明确角色和节奏恢复服务。
        • 🧠 知识拆解 ^xm-4b7bc34b969b4fca96fb4eeaa8
          • 事件等级与影响标准
          • Incident Commander/Operations/Communications
          • 升级路径与交接
          • 内部/外部沟通
          • 事实/假设/行动分离
          • 重大事件时间线
        • ⌨️ 命令 / 配置 / 关键对象 ^xm-f57ef443abba4af6a18fbaa8e3
          • 事件模板
          • 状态页
          • 会议/频道命名
          • 定时更新节奏
          • 交接清单
        • 🔥 高频故障与风险 ^xm-ffed69d8aaff4da7a3f3b8298c
          • 多人同时操作
          • 没有单一指挥
          • 只排技术不沟通
          • 时间线事后凭记忆
        • 🔎 排障路径 ^xm-820e949740524a00b35828ac90
          • 先确认用户影响与范围
          • 冻结非必要变更
          • 每个动作记录 owner/预期/结果
        • 🧪 实战练习 ^xm-3b52c3fb9087410ca11a3d1b69
          • 桌面推演数据库不可用
          • 模拟跨团队重大事件 60 分钟
        • ✅ 验收标准 ^xm-d0c24c7963d5449eb980485159
          • 5 分钟内建立指挥
          • 15 分钟内首次状态更新
          • 所有高风险操作可追溯
        • 🔗 对应优秀开源项目 ^xm-f5593fea71844abcb6d8cf09a4
          • keephq/keep

            备注(源图文本,未作运行验证):

            定位:开源告警管理与 AIOps 平台
            源码阅读:provider→alert→dedup/correlation→workflow
            实战:汇聚 Prometheus/Grafana 告警并去重关联
            注意:AI 总结不能替代确定性路由和审计
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/keephq/keep
          • robusta-dev/robusta

            备注(源图文本,未作运行验证):

            定位:K8s 告警增强与自动化处置
            源码阅读:alert webhook→enrichment→playbook→sink
            实战:为 OOM/Pending/CrashLoop 自动补充证据
            注意:自动修复必须白名单、幂等、可回滚
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/robusta-dev/robusta
      • 无责复盘与问题管理 ^xm-07b63fea421949b1a90516b83c
        • 🎯 目标 ^xm-5d3703a59e7d4769bc4cf67909
          • 把故障转化为系统性改进而不是个人归因。
        • 🧠 知识拆解 ^xm-d4f64ece856543af8e83615ab0
          • root cause vs contributing factors
          • five whys 的局限
          • 控制失效与检测缺口
          • 行动项优先级
          • 重复事件与问题单
          • 复盘质量指标
        • ⌨️ 命令 / 配置 / 关键对象 ^xm-68d24595bf3048b18c4346f2b4
          • 时间线模板
          • 影响量化
          • 证据链接
          • 行动项 owner/deadline
          • 复发跟踪
        • 🔥 高频故障与风险 ^xm-44b0ec9ad4d542e7b7e581aa7b
          • 只写操作失误
          • 行动项全是加强培训
          • 没有完成追踪
          • 复盘隐藏近失事件
        • 🔎 排障路径 ^xm-fc8cff9864a048ef85cb4373c8
          • 从系统条件解释行为
          • 识别为何未提前发现
          • 检查同类风险面
        • 🧪 实战练习 ^xm-a56b981f7bc840d2a22744cf61
          • 重写一份责备式复盘
          • 对历史故障做行动项有效性回看
        • ✅ 验收标准 ^xm-cfd662cd098446abb71c5f6b6e
          • 行动项可验证
          • 高风险项有截止时间
          • 复盘结论进入标准/自动化
      • 变更、发布与风险治理 ^xm-da5f70f21364423ba8649dc6b7
        • 🎯 目标 ^xm-fa73754a645d4e68bcb0a5b94d
          • 用小批量、可观测、可回滚方式降低变更失败率。
        • 🧠 知识拆解 ^xm-1f7eabf092ee4caea1bf652b8a
          • 标准/普通/紧急变更
          • blast radius
          • canary/blue-green/rolling
          • feature flag
          • 变更冻结与维护窗口
          • DORA 指标
        • ⌨️ 命令 / 配置 / 关键对象 ^xm-e59e73d4cb064524a726c4f87a
          • change record
          • pre-check/post-check
          • rollback trigger
          • 自动化审计
          • 发布日历
        • 🔥 高频故障与风险 ^xm-712e3b46de3942d89d9587a197
          • 无回滚
          • 一次变更多个系统
          • 紧急变更常态化
          • 成功只看流水线绿灯
        • 🔎 排障路径 ^xm-9c44d891638b4b9288ce409e57
          • 关联部署标记与错误率
          • 检查配置/镜像/依赖 diff
          • 验证用户旅程和数据
        • 🧪 实战练习 ^xm-ea1c0d466af346ff8d10195533
          • 设计 10% 金丝雀发布
          • 演练自动回滚和人工回滚
        • ✅ 验收标准 ^xm-4e8a4a55bc994352acc75e77e2
          • 变更可追到 commit/审批/制品
          • 回滚时间符合目标
          • 失败变更率持续下降
        • 🔗 对应优秀开源项目 ^xm-2950279b2be24d02ac37d3e86a
          • argoproj/argo-cd

            备注(源图文本,未作运行验证):

            定位:声明式 Kubernetes 持续交付
            源码阅读:repo-server→application-controller→diff/sync
            实战:实现多环境、sync wave、回滚
            注意:自动同步前先治理 secret 和变更审批
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/argoproj/argo-cd
          • fluxcd/flux2

            备注(源图文本,未作运行验证):

            定位:可组合 GitOps Toolkit
            源码阅读:Source→Kustomize/Helm Controller→Notification
            实战:Git/OCI source、镜像自动更新与 SOPS
            注意:多租户时明确 source 与 namespace 权限
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/fluxcd/flux2
      • 容量、成本与生命周期 ^xm-2ecddc14c9b344448a288393cb
        • 🎯 目标 ^xm-0de1eec6b5194287be60a47245
          • 提前识别容量拐点,并把可靠性和成本放在同一决策中。
        • 🧠 知识拆解 ^xm-2eec31cddb2a4e06bbef95d99d
          • 需求预测与季节性
          • headroom
          • 瓶颈资源
          • 排队论直觉
          • 单位业务成本
          • EOL/EOS 风险
        • ⌨️ 命令 / 配置 / 关键对象 ^xm-564b6d62a6034c5ca43d6c8447
          • 容量模型
          • 水位阈值
          • 扩容 lead time
          • FinOps 标签
          • 版本生命周期清单
        • 🔥 高频故障与风险 ^xm-a6bc80f3387f408e8f18265922
          • 平均值掩盖峰值
          • 扩容依赖临时采购
          • 闲置资源无人负责
          • 组件过期无升级路径
        • 🔎 排障路径 ^xm-ae475547b1194bcdbc133981a6
          • 按用户/租户/功能拆成本
          • 对峰值做 what-if
          • 核对限额与配额
        • 🧪 实战练习 ^xm-760b5171123949c69bf461ca96
          • 为 3 倍流量做容量计划
          • 制定一个组件的升级/退役计划
        • ✅ 验收标准 ^xm-f15272d300294382b29d57c93b
          • 关键资源有 90 天预测
          • 成本异常可归因
          • 版本风险进入季度计划
        • 🔗 对应优秀开源项目 ^xm-c6c0f82ddc9d408b88b2e66faf
          • robusta-dev/krr

            备注(源图文本,未作运行验证):

            定位:基于 Prometheus 的 K8s 资源建议
            源码阅读:历史指标→算法→recommendation
            实战:对 requests/limits 做建议与回归
            注意:建议需结合峰值、突发和 SLO 审核
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/robusta-dev/krr
    • ★ [新增] 可靠性目标 ^xm-a962f668854343f989e5866452
      • SLI:可量化的服务指标 ^xm-b1c70ecead774caa9905f35738
        • 可用性
        • 延迟
        • 错误率
        • 吞吐量
        • 数据正确性与新鲜度
      • SLO:目标与统计窗口 ^xm-2112f6c5bfca4c3e9e50a347a4
        • 目标值与窗口
        • 分层服务目标
        • 用户旅程与关键链路
      • 错误预算 ^xm-0a7955af703f4810925f57d114
        • 消耗速率 Burn Rate
        • 发布门禁
        • 稳定性与迭代速度平衡
      • SLA:对外承诺与责任边界
    • ★ [新增] 运维治理 ^xm-fa7420905daa414b8d28aac92a
      • 服务目录与负责人
      • 环境与配置基线
      • 资产、CMDB 与依赖关系
      • 变更分级、评审与审计
      • 维护窗口与发布日历
      • 容量、成本与生命周期管理
    • ★ [新增] 事件管理 ^xm-f96639a08e6a4391b67610f60f
      • 事件分级与升级路径
      • On-call 值班与交接
      • 故障指挥与沟通机制
      • Runbook 与自动化处置
      • 无责复盘与行动项闭环
      • 演练、GameDay 与混沌工程