可观测性与应急
让指标、日志、追踪、告警和应急动作共同服务于判断,而不是制造更多噪声。
主题分组
- 可观测性体系:指标、日志、追踪、上下文、采样和数据保留。
- 监控设计:从服务目标、风险和动作反推指标与告警。
- Prometheus:指标语义、PromQL、抓取、规则、标签和容量。
- Zabbix:版本限定、部署记录、模板、触发器和迁移边界。
- 应急排障闭环:发现、分级、证据、缓解、恢复、复盘和行动项。
故障入口
告警 → 验证信号是否真实 → 关联服务与依赖 → 选择 Troubleshooting → 满足条件后进入 Runbook。
Map 路线
服务目标 → 指标/日志 → 告警语义 → 诊断入口 → 应急协作 → 恢复验证 → 复盘改进。
返回 运维知识库总图。