模块资料|Kubernetes GPU 调度与隔离
原图深度模块的结构化资料摘录,保留目标、知识、命令线索、风险、排障、练习与验收。它不是一张原子知识卡,也不是可直接执行的操作手册。
所属方向:AI Infra。
目标
- 用 Device Plugin/GPU Operator/MIG/时间切片管理 GPU。
知识拆解
- device plugin
- GPU Operator
- MIG
- time-slicing/MPS
- node labels/taints
- topology-aware scheduling
- quota
命令 / 配置 / 关键对象
以下是原图中的命令名、缩写或配置对象,并非经校验的完整命令行;其中可能含写操作。执行前必须补齐版本、权限、目标和风险。
- GPU resources
- NodeFeatureDiscovery
- ClusterPolicy
- DCGM metrics
- scheduler events
高频故障与风险
- GPU Pending
- 驱动 Pod 失败
- MIG 配置漂移
- 共享干扰
- 拓扑不佳
排障路径
- resource advertise→scheduler→runtime→device
- 核对 operator components
- 看 topology/health
实战练习
- GPU Operator 架构演练
- MIG/共享策略设计
验收标准
- 租户隔离
- 调度可解释
- 故障节点自动隔离
对应优秀开源项目
- NVIDIA/gpu-operator;原链接:
https://github.com/NVIDIA/gpu-operator - NVIDIA/k8s-device-plugin;原链接:
https://github.com/NVIDIA/k8s-device-plugin
继续拆卡的规则
本页是资料入口。只在形成一个能独立解释、带依据与边界的认识后,提炼为 Concept;故障观察进入 Troubleshooting,满足诊断条件的处置进入 Runbook,真实事件进入 Incident。