模块资料|AIOps Agent 评测与实验场

原图深度模块的结构化资料摘录,保留目标、知识、命令线索、风险、排障、练习与验收。它不是一张原子知识卡,也不是可直接执行的操作手册。

所属方向:AI Infra

目标

  • 在可复现故障、负载和遥测环境中评价 Agent。

知识拆解

  • detection/localization/analysis/mitigation
  • fault injection
  • workload
  • ground truth
  • action trace
  • TTD/TTL/TTA/TTM
  • safety

命令 / 配置 / 关键对象

以下是原图中的命令名、缩写或配置对象,并非经校验的完整命令行;其中可能含写操作。执行前必须补齐版本、权限、目标和风险。

  • AIOpsLab problem
  • fault/workload generator
  • evaluator
  • session trace
  • batch assessment

高频故障与风险

  • 只测成功案例
  • judge 与 agent 同源偏差
  • 环境不可复现
  • 只看最终答案不看危险动作

排障路径

  • 固定环境/模型/工具/预算
  • 多次运行报告方差
  • 人工核对高风险轨迹

实战练习

  • 新增一个错误配置问题
  • 对 2 个 Agent 做多次对比

验收标准

  • 任务/指标公开
  • 结果可重放
  • 安全违规单独计分
  • 人工基线存在

对应优秀开源项目

继续拆卡的规则

本页是资料入口。只在形成一个能独立解释、带依据与边界的认识后,提炼为 Concept;故障观察进入 Troubleshooting,满足诊断条件的处置进入 Runbook,真实事件进入 Incident。

来源

查看完整原图节点与备注