模块资料|运维 Agent、MCP 与自动处置

原图深度模块的结构化资料摘录,保留目标、知识、命令线索、风险、排障、练习与验收。它不是一张原子知识卡,也不是可直接执行的操作手册。

所属方向:AI Infra

目标

  • 构建只读优先、可停止、可审计、可评估的运维 Agent。

知识拆解

  • tool schema
  • read vs write
  • least privilege
  • plan/act/observe
  • state/checkpoint
  • approval
  • rollback
  • MCP

命令 / 配置 / 关键对象

以下是原图中的命令名、缩写或配置对象,并非经校验的完整命令行;其中可能含写操作。执行前必须补齐版本、权限、目标和风险。

  • Grafana/K8s MCP
  • tool allowlist
  • max steps/time/cost
  • sandbox
  • audit trace

高频故障与风险

  • 无限循环
  • 错误命令
  • 越权
  • 数据泄漏
  • 自动修复扩大影响
  • 提示注入

排障路径

  • 逐步回放轨迹
  • 核对工具输入/输出
  • 检查权限/预算/停止条件
  • 人工复核结论

实战练习

  • 只读事件调查 Agent
  • 审批式安全重启/扩容

验收标准

  • 生产默认只读
  • 写操作白名单+审批
  • 失败可回滚
  • 每次行动可重放

对应优秀开源项目

继续拆卡的规则

本页是资料入口。只在形成一个能独立解释、带依据与边界的认识后,提炼为 Concept;故障观察进入 Troubleshooting,满足诊断条件的处置进入 Runbook,真实事件进入 Incident。

来源

查看完整原图节点与备注