GPU 故障要区分驱动运行时容器与框架
来源整理卡:基于原图提炼,尚未补充独立官方资料和环境实测。
核心认识
GPU 可用性需要在驱动、运行时、容器和框架等边界分别检查。
解释
原图把兼容矩阵、内核模块、动态库、容器设备和框架 CUDA 信息分层组织。不要把设备可见、框架可初始化和模型可稳定运行写成同一个结论。
什么时候使用
驱动升级、容器看不到卡或框架无法使用 CUDA 时。
边界
这是思考与取证原则,不证明某次故障根因,也不授权执行修改。具体参数和组件行为仍要依据版本与环境核验。
用一个问题检查是否真正理解
故障最早出现在哪一层,同一环境的版本与最小测试证据是否齐全?
原图依据
- 稳定管理 driver/CUDA/runtime/framework/容器版本。
原图知识项:
- kernel driver vs CUDA toolkit
- driver backward compatibility
- cuDNN/NCCL
- container runtime
- framework wheels
- kernel module lifecycle
有意义的关联
先从 AI Infra 找到使用场景;需要进一步查命令、风险或练习时,进入 驱动、CUDA、容器与兼容矩阵。
来源:原图节点。