来源快照|可观测性与应急

本页是原图的只读导入快照,不是已核验文档。原有历史命令、版本标记与疑点保留;已识别口令替换为占位符。图片只保留引用。

  • 可观测性与应急 ^xm-2be9e6d223a84907a5a82f4935
    • ◆ 2026 深度扩展|可观测性、应急与混沌

      • 可观测性设计:Metrics/Logs/Traces/Profiles/Events ^xm-b41951fc751e447abf09104381
        • 🎯 目标 ^xm-ee8e6b9c5e8c43e79cd05ba2d1
          • 用多信号回答系统内部为何如此,而非只堆工具。
        • 🧠 知识拆解 ^xm-0b9f8eb7afcf40ed818e4e36fe
          • telemetry vs observability
          • RED/USE/golden signals
          • resource/service identity
          • correlation IDs
          • cardinality
          • sampling/retention/cost
        • ⌨️ 命令 / 配置 / 关键对象 ^xm-7341d9896f974eb1812ceca2dd
          • 信号字典
          • 命名约定
          • resource attributes
          • 数据分级与保留
          • 成本预算
        • 🔥 高频故障与风险 ^xm-81f8eff2a3c44f9a8a0e17bc88
          • 信号无法关联
          • 标签基数爆炸
          • 日志无结构
          • trace 采样漏掉错误
          • 监控自身失明
        • 🔎 排障路径 ^xm-39e19e7f972744789d5f003fae
          • 从一个用户请求贯穿五类信号
          • 检查时间同步与身份字段
          • 评估信号覆盖缺口
        • 🧪 实战练习 ^xm-65ff0196c3cc41988aac23eab2
          • 给示例服务设计遥测规范
          • 对一次故障做跨信号 RCA
        • ✅ 验收标准 ^xm-019f4b45d4be48e98083ca4e05
          • 每个信号对应问题
          • 能从告警下钻到证据
          • 成本可归因
        • 🔗 对应优秀开源项目 ^xm-c15b39f876a84ec3b7dec94ce8
          • open-telemetry/opentelemetry-demo

            备注(源图文本,未作运行验证):

            定位:多语言微服务可观测实验场
            源码阅读:请求跨服务 trace 与故障场景
            实战:补齐 telemetry coverage 并注入故障
            注意:把它作为实验系统,不直接照搬生产配置
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/open-telemetry/opentelemetry-demo
          • grafana/grafana

            备注(源图文本,未作运行验证):

            定位:多数据源可观测与可视化平台
            源码阅读:datasource→query→panel→dashboard→alert
            实战:做服务总览、下钻和事件注释
            注意:看板不是越多越好,应围绕决策设计
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/grafana/grafana
      • OpenTelemetry 采集管道 ^xm-1f72666c506a400b89449bab93
        • 🎯 目标 ^xm-5d4c88ad2f7a464094c7f42d1f
          • 实现厂商中立、可靠、可观测的遥测接收、处理和导出。
        • 🧠 知识拆解 ^xm-17c1b72d1e3c4deaa7f23ec8b1
          • API/SDK/auto-instrumentation
          • OTLP
          • receiver/processor/exporter
          • agent/gateway
          • batch/memory limiter
          • tail sampling
        • ⌨️ 命令 / 配置 / 关键对象 ^xm-bf4fd5c6fca24c6892f21d867e
          • Collector config
          • health_check/zpages/pprof
          • queue/retry
          • transform/filter
          • resource detection
        • 🔥 高频故障与风险 ^xm-348c6957f0684812b680575729
          • 数据丢失
          • 内存爆炸
          • exporter 重试风暴
          • 属性污染
          • 采样错误
        • 🔎 排障路径 ^xm-6992a400c19944609b207033a3
          • 检查 Collector 自身指标
          • 逐 pipeline 验证接收/导出
          • 看 queue/drop/refused spans
        • 🧪 实战练习 ^xm-37eb3cef7f534201aa7926d29a
          • 双层 agent+gateway
          • 脱敏、tail sampling、双写
        • ✅ 验收标准 ^xm-a521b4981dd341b8b9d82cc24f
          • 后端故障不拖垮业务
          • 数据丢弃可告警
          • 配置有负载测试
        • 🔗 对应优秀开源项目 ^xm-95d987ce7ced4c93ba8f5ad359
          • open-telemetry/opentelemetry-collector

            备注(源图文本,未作运行验证):

            定位:厂商中立遥测管道
            源码阅读:receiver→processor→exporter→extension
            实战:批处理、采样、脱敏、双写后端
            注意:Collector 自身也必须被监控
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/open-telemetry/opentelemetry-collector
          • grafana/alloy

            备注(源图文本,未作运行验证):

            定位:可编程 OpenTelemetry Collector 发行版
            源码阅读:component graph、receiver/processor/exporter
            实战:构建 metrics/logs/traces pipeline
            注意:先设计背压、队列、重试和内存限制
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/grafana/alloy
      • Prometheus、PromQL 与 TSDB ^xm-c75be40dc4304d27ba90905fec
        • 🎯 目标 ^xm-fa53ca37e4924435ae884f86cb
          • 稳定采集指标、控制基数并写出可维护查询。
        • 🧠 知识拆解 ^xm-229490ad76e9408eb4b8131096
          • pull/service discovery
          • metric types
          • label model
          • WAL/block/compaction
          • PromQL vector matching
          • recording rules
          • federation/remote write
        • ⌨️ 命令 / 配置 / 关键对象 ^xm-9d4b82de9c5e4e9ca7170d0a67
          • promtool check/test rules
          • up/scrape metrics
          • rate/increase/histogram_quantile
          • topk/sum by
          • TSDB status
        • 🔥 高频故障与风险 ^xm-f4d6b667d41444c19c5ceca0a0
          • scrape down
          • 高基数/OOM
          • remote write backlog
          • 慢查询
          • histogram 使用错误
        • 🔎 排障路径 ^xm-5513619b85e14b57a40dd604c2
          • target→scrape→ingest→query→rule
          • 检查 series churn/cardinality
          • 解释 query plan 与时间范围
        • 🧪 实战练习 ^xm-ebc73fbafd66493fa11ebaa10f
          • 实现 RED/USE 看板
          • 写并测试 SLO recording/alert rules
        • ✅ 验收标准 ^xm-a7c6c2f592ac417fa48ec7aec3
          • 规则有单测
          • 基数预算
          • 查询在目标时间内完成
        • 🔗 对应优秀开源项目 ^xm-0ea61cd0064d47c59428eaff57
          • prometheus/prometheus

            备注(源图文本,未作运行验证):

            定位:指标采集、TSDB 与 PromQL
            源码阅读:discovery→scrape→WAL/TSDB→query→rules
            实战:四类黄金信号、recording rules、容量估算
            注意:控制标签基数,避免把日志字段当 label
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/prometheus/prometheus
          • prometheus-operator/kube-prometheus

            备注(源图文本,未作运行验证):

            定位:Kubernetes 监控栈与规则样板
            源码阅读:Operator CRD、mixins、rules、dashboards
            实战:在 kind 部署并改造一条 SLO 告警
            注意:默认规则需要结合环境降噪
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/prometheus-operator/kube-prometheus
      • 日志工程与 Loki ^xm-1ee2e867a2144c95b806989472
        • 🎯 目标 ^xm-720ed59af92944a9a752258af9
          • 让日志结构化、可关联、可检索、成本可控。
        • 🧠 知识拆解 ^xm-5fac661632654264bd9dad9e0d
          • event schema/level
          • request/trace id
          • PII/secret redaction
          • label vs content
          • ingest/chunk/index
          • retention/compaction
        • ⌨️ 命令 / 配置 / 关键对象 ^xm-aaa6f5bfad3543b1a4ac5156e4
          • structured JSON
          • LogQL
          • Alloy pipeline
          • derived fields
          • log-based alerts
        • 🔥 高频故障与风险 ^xm-3bdb293f87ff4260ad423edb6d
          • 高基数标签
          • 日志风暴
          • 多行解析失败
          • 敏感信息泄露
          • 查询扫描过大
        • 🔎 排障路径 ^xm-f8c3d49f611143f2a6219a3293
          • 应用输出→agent→ingest→store→query
          • 检查 drop/error/lag
          • 按 label selector 缩小
        • 🧪 实战练习 ^xm-6b3ea0475d3743c5bd4b1d065a
          • 设计统一日志 schema
          • Loki 查询与 trace correlation
        • ✅ 验收标准 ^xm-20fe1eb7b5f344c49a7909cca9
          • 日志不含密钥
          • 查询可定位到实例/请求
          • 保留与成本有策略
        • 🔗 对应优秀开源项目 ^xm-2adf05aab94a48bea1cabf1394
          • grafana/loki

            备注(源图文本,未作运行验证):

            定位:标签索引的云原生日志系统
            源码阅读:ingest→chunk/index→store→query frontend
            实战:设计低基数 labels 与 LogQL 告警
            注意:日志内容不可作为高基数标签
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/grafana/loki
          • grafana/alloy

            备注(源图文本,未作运行验证):

            定位:可编程 OpenTelemetry Collector 发行版
            源码阅读:component graph、receiver/processor/exporter
            实战:构建 metrics/logs/traces pipeline
            注意:先设计背压、队列、重试和内存限制
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/grafana/alloy
      • 分布式追踪与 Tempo/Jaeger ^xm-97e7057f637b4e8f9d1b3f5f19
        • 🎯 目标 ^xm-f36bac245ce546279d3b5cd323
          • 定位跨服务延迟、错误和依赖传播。
        • 🧠 知识拆解 ^xm-a9313aa04dbb4e50970c04ecd6
          • trace/span/context propagation
          • semantic conventions
          • head/tail sampling
          • span links/baggage
          • service graph
          • exemplar
        • ⌨️ 命令 / 配置 / 关键对象 ^xm-0b0a599ff7b44dbc968b296eb7
          • OTel SDK/agent
          • TraceQL
          • Jaeger query
          • span metrics
          • trace-to-logs
        • 🔥 高频故障与风险 ^xm-d3816bc0e88f4511be420cbd9f
          • 上下文断裂
          • 根 span 缺失
          • 过度采样
          • PII 进入 attributes
          • 时钟偏差
        • 🔎 排障路径 ^xm-c260d1c697ba477589cfb0cd6c
          • 从入口 trace id
          • 检查 propagation header
          • 分析 critical path
          • 关联 deploy/events
        • 🧪 实战练习 ^xm-52fd5cf37bf04078bd091abb4b
          • 多服务 trace
          • tail sampling 保留错误/慢请求
        • ✅ 验收标准 ^xm-5751098cc9de4c8b8d6d2cbfd7
          • 关键链路覆盖
          • 采样可解释
          • 延迟归因到具体 span
        • 🔗 对应优秀开源项目 ^xm-2d1c6942da9948f8a1b052dd74
          • grafana/tempo

            备注(源图文本,未作运行验证):

            定位:大规模分布式追踪后端
            源码阅读:distributor→ingester→block→querier
            实战:trace-to-logs、trace-to-metrics、exemplar
            注意:采样策略必须兼顾成本与错误保留
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/grafana/tempo
          • jaegertracing/jaeger

            备注(源图文本,未作运行验证):

            定位:CNCF 分布式追踪平台
            源码阅读:collector→storage→query→UI
            实战:比较 head/tail sampling 与错误保留
            注意:新架构与 OTel Collector 兼容性要按版本核对
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/jaegertracing/jaeger
      • 持续剖析与性能观测 ^xm-397c8bc6f90747c78160d9496d
        • 🎯 目标 ^xm-c5e9d15e95524a2e959c9eb892
          • 将函数级 CPU/内存热点与请求和版本关联。
        • 🧠 知识拆解 ^xm-f76ca1cef10947edb3b5225a5f
          • CPU/heap/alloc/lock profiles
          • continuous profiling
          • flame graph
          • symbolization
          • profile labels
          • overhead
        • ⌨️ 命令 / 配置 / 关键对象 ^xm-27ee6c8c876d482a8667295091
          • perf/pprof/async-profiler
          • Pyroscope
          • profile-to-trace
        • 🔥 高频故障与风险 ^xm-7b2ec193ed464086ae7531acfb
          • CPU 热点
          • 分配风暴
          • 锁竞争
          • 符号缺失
          • 采样开销
        • 🔎 排障路径 ^xm-faef8687e6454c40bd30b7f32c
          • 按版本/实例/请求切片
          • 比较前后 flame graph
          • 确认热点是否在 critical path
        • 🧪 实战练习 ^xm-947d1cb0a5ce4a6e8cbf2c3a66
          • 定位一处性能瓶颈
          • 把 profile 与 trace 关联
        • ✅ 验收标准 ^xm-8708a94d11f94303a7c7f9a111
          • 优化前后相同负载
          • 开销已测
          • 证据可重复
        • 🔗 对应优秀开源项目 ^xm-831cb2138a9b4cdc84ced1ffd6
          • grafana/pyroscope

            备注(源图文本,未作运行验证):

            定位:持续性能剖析
            源码阅读:agent→profile ingest→storage→flame graph
            实战:定位 CPU 热点并与 trace 关联
            注意:处理符号、隐私与采样开销
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/grafana/pyroscope
      • 告警工程与降噪 ^xm-2a79282610ff4416a9bd421715
        • 🎯 目标 ^xm-a90eb4cbe4d64a5590bcedbaaa
          • 让告警可行动、低噪声、带上下文并与 SLO 对齐。
        • 🧠 知识拆解 ^xm-31916ae2626f4e7c9b27ff56f1
          • symptom vs cause
          • severity/urgency
          • grouping/dedup/inhibition
          • multi-window burn rate
          • silence/maintenance
          • runbook
        • ⌨️ 命令 / 配置 / 关键对象 ^xm-d79a3bca266c48d9979205c358
          • Alertmanager routes
          • rule unit tests
          • annotations/labels
          • notification templates
          • alert quality metrics
        • 🔥 高频故障与风险 ^xm-37beda081d7b439eb13587c4f3
          • 告警风暴
          • 同一事件多页
          • 恢复不通知
          • 阈值静态且无依据
          • 无人负责
        • 🔎 排障路径 ^xm-d38b31e81b64491a8468c51f7b
          • 统计 page/action ratio
          • 回放历史故障
          • 识别重复与依赖抑制
          • 检查路由 owner
        • 🧪 实战练习 ^xm-c3367e05f453402f885758c33c
          • 重构 10 条低质量告警
          • 建立告警质量 dashboard
        • ✅ 验收标准 ^xm-3a4dfcb5290e4416bdc1e3c007
          • 每条 page 需要人立即行动
          • 含影响/证据/runbook
          • 噪声持续下降
        • 🔗 对应优秀开源项目 ^xm-49ca2e3755314f8a8aa2108e10
          • prometheus/alertmanager

            备注(源图文本,未作运行验证):

            定位:告警分组、路由、抑制与静默
            源码阅读:grouping→routing→inhibition→receiver
            实战:按服务/严重级别路由并做抑制
            注意:告警必须可行动且有 owner/runbook
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/prometheus/alertmanager
          • keephq/keep

            备注(源图文本,未作运行验证):

            定位:开源告警管理与 AIOps 平台
            源码阅读:provider→alert→dedup/correlation→workflow
            实战:汇聚 Prometheus/Grafana 告警并去重关联
            注意:AI 总结不能替代确定性路由和审计
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/keephq/keep
          • robusta-dev/robusta

            备注(源图文本,未作运行验证):

            定位:K8s 告警增强与自动化处置
            源码阅读:alert webhook→enrichment→playbook→sink
            实战:为 OOM/Pending/CrashLoop 自动补充证据
            注意:自动修复必须白名单、幂等、可回滚
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/robusta-dev/robusta
      • 事件响应、RCA 与证据链 ^xm-b96b68c151204cc0826e381437
        • 🎯 目标 ^xm-188586d5359d483b90024a3ada
          • 快速止损并用证据验证根因。
        • 🧠 知识拆解 ^xm-fcc72ab6f54a4952a41e86543d
          • triage/mitigation/diagnosis/recovery
          • timeline
          • change correlation
          • causal graph
          • counterfactual validation
          • known unknowns
        • ⌨️ 命令 / 配置 / 关键对象 ^xm-72f62e721244433ca0dbfdb88c
          • 事件频道/模板
          • dashboard annotations
          • config diff
          • trace/log/metric links
          • evidence bundle
        • 🔥 高频故障与风险 ^xm-50691e54cb224ea3b8a7c91ca7
          • 先入为主
          • 同时改多项
          • 恢复即结束
          • 根因无法解释全部现象
        • 🔎 排障路径 ^xm-e8c6d31a4e6d460c8cfd4440a2
          • 列事实/假设/待验证
          • 按时间和依赖缩小
          • 选择区分度最高的测试
          • 恢复后反证
        • 🧪 实战练习 ^xm-e99b4b1a7df347c7a69360196c
          • 用 OTel Demo 完成一次 RCA
          • 对相似症状区分 3 个根因
        • ✅ 验收标准 ^xm-2b58276f64f741bc8008c429b8
          • 结论附直接证据
          • 可解释影响边界
          • 改进覆盖检测与预防
        • 🔗 对应优秀开源项目 ^xm-ee14e9d1ba8347d7bfe3e4dd3c
          • open-telemetry/opentelemetry-demo

            备注(源图文本,未作运行验证):

            定位:多语言微服务可观测实验场
            源码阅读:请求跨服务 trace 与故障场景
            实战:补齐 telemetry coverage 并注入故障
            注意:把它作为实验系统,不直接照搬生产配置
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/open-telemetry/opentelemetry-demo
          • HolmesGPT/holmesgpt

            备注(源图文本,未作运行验证):

            定位:CNCF Sandbox SRE 事件调查 Agent
            源码阅读:toolset→investigation→evidence→conclusion
            实战:接入只读 Prometheus/Loki/K8s 并评估 RCA
            注意:生产默认只读,结论必须附证据与置信度
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/HolmesGPT/holmesgpt
      • 混沌工程与 GameDay ^xm-aa6c41e380924b85a72ef4f6e1
        • 🎯 目标 ^xm-af344a86f83e412eaf472cd981
          • 在可控风险下验证系统韧性、监控和人员流程。
        • 🧠 知识拆解 ^xm-1356635b544045c6b3431fcbd8
          • steady state hypothesis
          • blast radius
          • fault model
          • abort condition
          • experiment observation
          • learning backlog
        • ⌨️ 命令 / 配置 / 关键对象 ^xm-bdfacc66738a41b0913caf201a
          • Chaos CRD/workflow
          • network/disk/pod faults
          • probes
          • experiment report
        • 🔥 高频故障与风险 ^xm-8f92389c42c640ec844a3ff2b2
          • 无停止条件
          • 测试生产核心路径过大
          • 只杀 Pod 不验证假设
          • 未通知相关团队
        • 🔎 排障路径 ^xm-a643cb14f6214ceca291c8d293
          • 实验前确认稳态
          • 实时看 SLO
          • 异常立即终止
          • 比较预期/实际
        • 🧪 实战练习 ^xm-90f2351d3ccb430888b54ed9c1
          • Pod kill/latency/DNS 故障
          • 季度跨团队 GameDay
        • ✅ 验收标准 ^xm-4eedb24ccd674250b7e79cc7c7
          • 实验有批准/回滚
          • 发现进入行动项
          • 重复实验验证修复
        • 🔗 对应优秀开源项目 ^xm-1c997bf6d5b240808dd7c9320e
          • chaos-mesh/chaos-mesh

            备注(源图文本,未作运行验证):

            定位:Kubernetes 混沌工程平台
            源码阅读:Chaos CRD→controller→daemon→fault
            实战:网络延迟、Pod kill、I/O 故障演练
            注意:必须有范围、停止条件、监控和回滚
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/chaos-mesh/chaos-mesh
          • litmuschaos/litmus

            备注(源图文本,未作运行验证):

            定位:云原生混沌与韧性验证
            源码阅读:experiment→engine/workflow→probe
            实战:把韧性实验接入发布门禁
            注意:先在隔离环境和小爆炸半径执行
            整理日期:2026-07-09
            • 原链接(未复核):https://github.com/litmuschaos/litmus
    • ★ [新增] 可观测性体系

      • 信号 ^xm-97d5aa84f716441e8e983fe4f0
        • Metrics
        • Logs
        • Traces
        • Profiles
        • Events
      • OpenTelemetry ^xm-0470e508a00d4979bf5618f747
        • 自动/手工埋点
        • 上下文传播
        • Collector
        • 采样策略
        • 语义约定
        • 日志与 Trace 关联
      • Prometheus 体系 ^xm-48aaec99212d4b1297ec49adce
        • 服务发现与抓取
        • Exporter
        • Recording Rules
        • Alerting Rules
        • Alertmanager
        • 高可用与长期存储
      • 日志平台 ^xm-91d8af907f6d452ebf49b9d9f2
        • 结构化日志
        • 采集与解析
        • 字段规范
        • 敏感数据处理
        • 索引与保留周期
        • ELK/OpenSearch/Loki
      • 告警工程 ^xm-fea2cf6c81704e0982d6bf7a81
        • 面向用户症状
        • 多窗口 Burn Rate
        • 抑制/聚合/静默
        • 告警路由
        • Runbook 链接
        • 告警有效性复盘
    • ★ [新增] 应急排障闭环

      • 发现与确认影响
      • 止损、隔离与降级
      • 时间线与证据留存
      • 根因定位
      • 恢复验证
      • 复盘与预防性改进
    • ⚠ [版本限定] Zabbix 4.2 源码安装记录

      备注(源图文本,未作运行验证):

      原步骤明确引用 Zabbix 4.2.1,属于历史版本部署记录。当前部署应核对受支持版本、官方仓库、数据库兼容性和升级路径。
      • 客户端搭建步骤: ^xm-4n6jr7m0990rbs30uk68oh62vu
        • 1.官网下载源码包
        • 2.yum install -y curl curl-devel net-snmp net-snmp-devel perl-DBI 安装依赖包
        • 3.useradd -M -s /sbin/nologin zabbix 增加zabbix用户不登录shell
        • 4.tar xf zabbix-4.2.1.tar.gz -C /usr/local/ 用zabbix用户解压源码包
          1. 进入解压路径执行./configure —prefix=/usr/local/zabbix —enable-agent (监控端安装开启agent)
          1. 执行编译make install
        • 7.启动:进入/usr/local/zabbix/sbin/zabbix_agented
      • 服务端搭建步骤 ^xm-33e8ihu33tcdpf7u6h7n0eb191
        • 1.官网下载源码包

          1. yum install net-snmp net-snmp-devel curl curl-devel libevent-(详见备注)

          备注(源图文本,未作运行验证):

          原节点完整内容:
          2. yum install net-snmp net-snmp-devel curl curl-devel libevent-devel net-snmp-devel libxml2-devel php-xml -y 安装依赖包
          1. 进入zabbix文件目录编译 ./configure —prefix=/usr/local/zabbix —enabl(详见备注)

          备注(源图文本,未作运行验证):

          原节点完整内容:
          3. 进入zabbix文件目录编译 ./configure --prefix=/usr/local/zabbix --enable-server --enable-agent --with-mysql --with-net-snmp --with-libcurl --with-libxml2 --with-gettext
        • 4.make && make install

        • 5.数据库添加zabbix数据库:create database zabbix default charset utf8;

        • 6.授权给zabbix用户:grant all on zabbix.* to zabbix@’%’ identified by ‘用户密码’;

        • 7.刷新权限表flush privileges;

        • 8.进入编译包zabbix下: /usr/local/zabbix-4.2.1/database/mysql

        • 9.导入三个sql脚本: (zabbix为数据库) cat schema.sql | mysql -uroot zabbix -(详见备注)

          备注(源图文本,未作运行验证):

          原节点完整内容:
          9.导入三个sql脚本: (zabbix为数据库)
           cat schema.sql | mysql -uroot zabbix -p
           cat images.sql | mysql -uroot zabbix -p
           cat data.sql | mysql -uroot zabbix -p
        • 10.配置zabbix服务端的配置文件

        • 11.复制相关库到lib下cp -frp /usr/lib64/libldap* /usr/lib/ 或者yum -y php(详见备注)

          备注(源图文本,未作运行验证):

          原节点完整内容:
          11.复制相关库到lib下cp -frp /usr/lib64/libldap* /usr/lib/               
          或者yum -y php php-ldap(轻量级目录访问协议)
        • 12.运行service httpd start 并且登录http://192.168.188.212/zabbix/

      • 测试跟客户端相通 ^xm-7313oo7g9ep2c1qdf70n86dfnn
        • 修改文件配置:vim /usr/local/zabbix/etc/zabbix_agentd.conf
        • 检查监测到服务端:/usr/local/zabbix/bin/zabbix_get -s 192.168.188.213 -p10050 -k system.uname
    • Prometheus

      • grafana UI看板

      • ⚑ [纠错] Pushgateway(批处理任务指标)

        备注(源图文本,未作运行验证):

        Pushgateway 主要用于无法被 Prometheus 正常拉取的短生命周期或批处理任务,不是通用代理网关。应管理指标生命周期,避免陈旧序列。
      • node_exporter节点监控

    • 从0设计监控体系

      • 指标 ^xm-0ut4rga2kj0mihom5fojdgul19
        • 系统资源指标
        • 业务指标
      • 日志 ^xm-721b0h95r92mdhbi559n721og7
        • 业务日志
        • 错误日志
      • 链路 ^xm-13a97osvvfmo0pgcok6uifff1h
        • OpenTelemetry
        • 核心链路埋点
    • 监控重点

      备注(源图文本,未作运行验证):

      1. 监控哪些部件
       
      2. 监控哪些指标
       
      3. 监控的方式(有没有变化)
       
      4. 出现异常如何判断问题点
       
       
      • 监控哪些部件 ^xm-0tr2hkbhb2fkj6aoq0sctd2ksh
        • Portal-session
        • 用户中心 ^xm-5q1gun6n295grmk0f0k4gqcc33
          • 登录方式
      • 监控的方式 ^xm-4j6cno1ib8i37gmba7onp85qkn
        • Kibana ^xm-36skjimm2euake7dgcb6i88dcu
          • 接口延时
          • 网线图:是否有明显变化
        • 命令统计
      • 监控哪些指标 ^xm-56c1nf1nrv2dt0hkctm8g18l17
        • 时延
        • 并发请求(session)
        • 消息队列
      • 问题点判断
    • 应急操作

      • Session修改 ^xm-0bv8em18muu7u4skg78e998jh8
        • 修改依据
        • 修改方式
      • Redis ^xm-45iaa054thdciffrnqubrvcvah
        • key备份 ^xm-0huq48ttt9ssg4b6jaiq96j8p3
          • save
          • bgsave
        • key恢复
        • 业务重启