模块资料|Kubernetes GPU 调度与隔离

原图深度模块的结构化资料摘录,保留目标、知识、命令线索、风险、排障、练习与验收。它不是一张原子知识卡,也不是可直接执行的操作手册。

所属方向:AI Infra

目标

  • 用 Device Plugin/GPU Operator/MIG/时间切片管理 GPU。

知识拆解

  • device plugin
  • GPU Operator
  • MIG
  • time-slicing/MPS
  • node labels/taints
  • topology-aware scheduling
  • quota

命令 / 配置 / 关键对象

以下是原图中的命令名、缩写或配置对象,并非经校验的完整命令行;其中可能含写操作。执行前必须补齐版本、权限、目标和风险。

  • GPU resources
  • NodeFeatureDiscovery
  • ClusterPolicy
  • DCGM metrics
  • scheduler events

高频故障与风险

  • GPU Pending
  • 驱动 Pod 失败
  • MIG 配置漂移
  • 共享干扰
  • 拓扑不佳

排障路径

  • resource advertise→scheduler→runtime→device
  • 核对 operator components
  • 看 topology/health

实战练习

  • GPU Operator 架构演练
  • MIG/共享策略设计

验收标准

  • 租户隔离
  • 调度可解释
  • 故障节点自动隔离

对应优秀开源项目

  • NVIDIA/gpu-operator;原链接:https://github.com/NVIDIA/gpu-operator
  • NVIDIA/k8s-device-plugin;原链接:https://github.com/NVIDIA/k8s-device-plugin

继续拆卡的规则

本页是资料入口。只在形成一个能独立解释、带依据与边界的认识后,提炼为 Concept;故障观察进入 Troubleshooting,满足诊断条件的处置进入 Runbook,真实事件进入 Incident。

来源

查看完整原图节点与备注