AI Infra

把 XMind 中的 GPU 平台、RAG 生产链路和 Agent 生产化能力组织成一条可运维的基础设施路线。

能力域

  • GPU:硬件拓扑、显存、PCIe/NVLink、ECC/Xid、DCGM 和维修隔离。
  • 软件栈:NVIDIA Driver、CUDA、cuDNN、NCCL、容器运行时和兼容矩阵。
  • Kubernetes GPU:Device Plugin、GPU Operator、MIG、调度、配额和升级。
  • 模型服务:vLLM、Triton、KServe、KV Cache、并发、TTFT/TPOT 和容量。
  • RAG:采集、清洗、分块、Embedding、向量库、混合检索、重排和评估。
  • Agent / AIOps:工具权限、MCP、只读优先、轨迹审计、人工审批和回滚。

运维边界

任何自动处置都要有最小权限、预算、最大步数、停止条件和可重放记录。高风险写操作默认人工审批。

关联 AI-GPU平台Kubernetes可观测性