AI / GPU 平台
从硬件可见性到模型服务可用性,分层记录 GPU、驱动、调度和 AI 应用链路。
主题分组
- GPU 硬件:设备、拓扑、温度、显存、健康和资源隔离。
- GPU 驱动:驱动、CUDA、容器运行时、设备插件和版本矩阵。
- GPU Operator:版本边界、安装、升级、节点标签和回滚。
- RAG:数据接入、切分、嵌入、向量库、检索、生成和评估。
- AI Agent:工具调用、权限、状态、观测、成本和失败降级。
- 向量数据库:索引、召回、容量、延迟、一致性和备份。
故障入口
GPU 可识别但业务不可用时,依次区分硬件可见、驱动可用、节点上报、调度分配、容器挂载和模型进程。
Map 路线
设备 → 驱动/CUDA → 节点资源 → 调度/容器 → 推理服务 → RAG/Agent 业务验收。
返回 运维知识库总图。