GPU 故障要区分驱动运行时容器与框架

来源整理卡:基于原图提炼,尚未补充独立官方资料和环境实测。

核心认识

GPU 可用性需要在驱动、运行时、容器和框架等边界分别检查。

解释

原图把兼容矩阵、内核模块、动态库、容器设备和框架 CUDA 信息分层组织。不要把设备可见、框架可初始化和模型可稳定运行写成同一个结论。

什么时候使用

驱动升级、容器看不到卡或框架无法使用 CUDA 时。

边界

这是思考与取证原则,不证明某次故障根因,也不授权执行修改。具体参数和组件行为仍要依据版本与环境核验。

用一个问题检查是否真正理解

故障最早出现在哪一层,同一环境的版本与最小测试证据是否齐全?

原图依据

  • 稳定管理 driver/CUDA/runtime/framework/容器版本。

原图知识项:

  • kernel driver vs CUDA toolkit
  • driver backward compatibility
  • cuDNN/NCCL
  • container runtime
  • framework wheels
  • kernel module lifecycle

有意义的关联

先从 AI Infra 找到使用场景;需要进一步查命令、风险或练习时,进入 驱动、CUDA、容器与兼容矩阵

来源:原图节点