GPU-已确认健康异常节点的隔离

执行状态:不可直接用于生产。 本页根据原图场景设计操作骨架,尚无环境绑定命令、参数、审批记录及演练证据。

进入条件

先完成 GPU 不可用排查。症状相似不等于条件成立。

  • 设备或节点健康证据明确且与目标对应
  • 已核对现有工作负载、迁移限制和业务影响
  • 已批准隔离范围与重新接纳条件

实施前必须补齐

环境与版本、目标唯一标识、执行与复核人员、审批单、命令与逐项参数说明、预期输出、监控基线、停止阈值、回退或补偿、演练记录。

操作阶段草案

  1. 保留健康、驱动、调度与运行时证据。
  2. 按已验证的平台流程阻止新增分配。
  3. 处理现有工作负载并开展硬件或软件验证。
  4. 达到预先定义条件后再接纳。

此处不提供可复制的高风险修改命令。补齐并演练后,再把该草稿修订为适配环境的执行文档。

停止条件

  • 节点共享业务未完成影响评估。
  • 迁移或隔离触发更大范围的资源不足。

回退、补偿与恢复验收

  • 避免在卡数异常但证据不足时直接重启全部组件。
  • 重新接纳前验证设备、容器、框架与业务测试。

执行证据

待填写:操作前、操作中、操作后;实际输出、业务结果、异常分支与复核人。真实执行后按 Incident 模板 留档,不能把演练假设写成生产事故。

来源场景: