可观测性

本页是技术方向导航。正文按 Type 存储;表中模块都是来自原图的资料摘录,不等于已完成的永久知识卡或生产手册。

这个方向解决什么

把分散信号组织成能解释问题的证据链。

Metrics/Logs/Traces/Profiles/Events、OpenTelemetry、Prometheus/PromQL、Loki、Tempo/Jaeger、持续剖析、告警、RCA、混沌与 GameDay。

原图分支:可观测性与应急;含 432 个主题节点、9 个深度模块。节点数仅反映原图展开程度,不代表掌握度或岗位重要性。

知识模块

模块资料原图目标
可观测性设计:Metrics/Logs/Traces/Profiles/Events用多信号回答系统内部为何如此,而非只堆工具。
OpenTelemetry 采集管道实现厂商中立、可靠、可观测的遥测接收、处理和导出。
Prometheus、PromQL 与 TSDB稳定采集指标、控制基数并写出可维护查询。
日志工程与 Loki让日志结构化、可关联、可检索、成本可控。
分布式追踪与 Tempo/Jaeger定位跨服务延迟、错误和依赖传播。
持续剖析与性能观测将函数级 CPU/内存热点与请求和版本关联。
告警工程与降噪让告警可行动、低噪声、带上下文并与 SLO 对齐。
事件响应、RCA 与证据链快速止损并用证据验证根因。
混沌工程与 GameDay在可控风险下验证系统韧性、监控和人员流程。

已提炼的概念卡

从故障现象进入

已确认诊断后的处置

当前方向没有环境绑定的执行手册。后续按 Runbook 模板 编写,不将资料中的命令线索直接当成操作流程。

项目与可验收产出

信号字典、跨信号关联、告警治理、故障调查与混沌实验。

跨方向关联

SRE 与运维治理Linux应用与中间件AI Infra。同一个知识对象只维护一份正文,从多个导航进入。

其他原有分支

真实案例

没有把知识题库伪装成历史事故。记录真实故障或演练时,进入 案例目录说明

来源

原图节点