可观测性
本页是技术方向导航。正文按 Type 存储;表中模块都是来自原图的资料摘录,不等于已完成的永久知识卡或生产手册。
这个方向解决什么
把分散信号组织成能解释问题的证据链。
Metrics/Logs/Traces/Profiles/Events、OpenTelemetry、Prometheus/PromQL、Loki、Tempo/Jaeger、持续剖析、告警、RCA、混沌与 GameDay。
原图分支:可观测性与应急;含 432 个主题节点、9 个深度模块。节点数仅反映原图展开程度,不代表掌握度或岗位重要性。
知识模块
| 模块资料 | 原图目标 |
|---|---|
| 可观测性设计:Metrics/Logs/Traces/Profiles/Events | 用多信号回答系统内部为何如此,而非只堆工具。 |
| OpenTelemetry 采集管道 | 实现厂商中立、可靠、可观测的遥测接收、处理和导出。 |
| Prometheus、PromQL 与 TSDB | 稳定采集指标、控制基数并写出可维护查询。 |
| 日志工程与 Loki | 让日志结构化、可关联、可检索、成本可控。 |
| 分布式追踪与 Tempo/Jaeger | 定位跨服务延迟、错误和依赖传播。 |
| 持续剖析与性能观测 | 将函数级 CPU/内存热点与请求和版本关联。 |
| 告警工程与降噪 | 让告警可行动、低噪声、带上下文并与 SLO 对齐。 |
| 事件响应、RCA 与证据链 | 快速止损并用证据验证根因。 |
| 混沌工程与 GameDay | 在可控风险下验证系统韧性、监控和人员流程。 |
已提炼的概念卡
从故障现象进入
已确认诊断后的处置
当前方向没有环境绑定的执行手册。后续按 Runbook 模板 编写,不将资料中的命令线索直接当成操作流程。
项目与可验收产出
信号字典、跨信号关联、告警治理、故障调查与混沌实验。
跨方向关联
SRE 与运维治理;Linux;应用与中间件;AI Infra。同一个知识对象只维护一份正文,从多个导航进入。
其他原有分支
真实案例
没有把知识题库伪装成历史事故。记录真实故障或演练时,进入 案例目录说明。