AI / GPU 平台

迁移入口

当前规范入口为 AI Infra;本页保留以兼容既有链接和早期分类。

从硬件可见性到模型服务可用性,分层记录 GPU、驱动、调度和 AI 应用链路。

主题分组

  • GPU 硬件:设备、拓扑、温度、显存、健康和资源隔离。
  • GPU 驱动:驱动、CUDA、容器运行时、设备插件和版本矩阵。
  • GPU Operator:版本边界、安装、升级、节点标签和回滚。
  • RAG:数据接入、切分、嵌入、向量库、检索、生成和评估。
  • AI Agent:工具调用、权限、状态、观测、成本和失败降级。
  • 向量数据库:索引、召回、容量、延迟、一致性和备份。

故障入口

GPU 可识别但业务不可用时,依次区分硬件可见、驱动可用、节点上报、调度分配、容器挂载和模型进程。

Map 路线

设备 → 驱动/CUDA → 节点资源 → 调度/容器 → 推理服务 → RAG/Agent 业务验收。

返回 运维知识库总图