故障现象导航
按现象进入诊断,不按猜测直接进入执行。以下 26 个提纲 来自原图的独立故障剧本页;同一现象可以跨多个技术方向。
| 故障现象 | 相关方向 |
|---|---|
| CPU 高 | Linux、可观测性 |
| 内存高/OOM | Linux、应用与中间件 |
| 磁盘满 | Linux、数据库与存储 |
| I/O 延迟 | Linux、数据库与存储 |
| 网络不通 | 网络 |
| HTTP 5xx | 应用与中间件、网络、CI-CD |
| DNS 故障 | 网络、虚拟化与云原生 |
| 数据库慢 | 数据库与存储 |
| 复制延迟 | 数据库与存储、备份容灾 |
| Redis 延迟 | 数据库与存储 |
| Pod Pending | 虚拟化与云原生 |
| CrashLoopBackOff | 虚拟化与云原生、应用与中间件 |
| OOMKilled | 虚拟化与云原生、Linux、应用与中间件 |
| ImagePullBackOff | 虚拟化与云原生、CI-CD |
| Service 不通 | 虚拟化与云原生、网络 |
| Ingress 404/502/504 | 虚拟化与云原生、网络、应用与中间件 |
| PVC Pending/挂载失败 | 虚拟化与云原生、数据库与存储 |
| 节点 NotReady | 虚拟化与云原生、Linux |
| Prometheus 无数据 | 可观测性 |
| 日志缺失 | 可观测性 |
| Trace 断链 | 可观测性 |
| 告警风暴 | 可观测性、SRE 与运维治理 |
| 证书过期 | 安全与合规、网络 |
| GPU 不可用 | AI Infra、虚拟化与云原生 |
| LLM 服务高延迟 | AI Infra、可观测性 |
| AIOps Agent 错误处置 | AI Infra、安全与合规、SRE 与运维治理 |
排障闭环
匹配现象 → 确认影响 → 收集证据 → 区分假设 → 核对处置条件 → 执行经过验证的 Runbook → 系统与业务验收 → 留下真实案例和预防改进。
当止损必须先行时,仍要记录授权、风险和现场证据;本导航不能替代操作权限控制。