模块资料|AIOps Agent 评测与实验场
原图深度模块的结构化资料摘录,保留目标、知识、命令线索、风险、排障、练习与验收。它不是一张原子知识卡,也不是可直接执行的操作手册。
所属方向:AI Infra。
目标
- 在可复现故障、负载和遥测环境中评价 Agent。
知识拆解
- detection/localization/analysis/mitigation
- fault injection
- workload
- ground truth
- action trace
- TTD/TTL/TTA/TTM
- safety
命令 / 配置 / 关键对象
以下是原图中的命令名、缩写或配置对象,并非经校验的完整命令行;其中可能含写操作。执行前必须补齐版本、权限、目标和风险。
- AIOpsLab problem
- fault/workload generator
- evaluator
- session trace
- batch assessment
高频故障与风险
- 只测成功案例
- judge 与 agent 同源偏差
- 环境不可复现
- 只看最终答案不看危险动作
排障路径
- 固定环境/模型/工具/预算
- 多次运行报告方差
- 人工核对高风险轨迹
实战练习
- 新增一个错误配置问题
- 对 2 个 Agent 做多次对比
验收标准
- 任务/指标公开
- 结果可重放
- 安全违规单独计分
- 人工基线存在
对应优秀开源项目
继续拆卡的规则
本页是资料入口。只在形成一个能独立解释、带依据与边界的认识后,提炼为 Concept;故障观察进入 Troubleshooting,满足诊断条件的处置进入 Runbook,真实事件进入 Incident。