模块资料|模型推理服务与容量

原图深度模块的结构化资料摘录,保留目标、知识、命令线索、风险、排障、练习与验收。它不是一张原子知识卡,也不是可直接执行的操作手册。

所属方向:AI Infra

目标

  • 运营低延迟、高吞吐、可回滚的模型服务。

知识拆解

  • prefill/decode
  • KV cache
  • continuous batching
  • quantization
  • tensor parallel
  • TTFT/TPOT
  • queue/autoscaling

命令 / 配置 / 关键对象

以下是原图中的命令名、缩写或配置对象,并非经校验的完整命令行;其中可能含写操作。执行前必须补齐版本、权限、目标和风险。

  • vLLM/Triton/KServe
  • OpenAI-compatible endpoint
  • load test
  • GPU metrics
  • model registry

高频故障与风险

  • OOM
  • 长队列
  • 尾延迟
  • 模型加载慢
  • 上下文过长
  • 量化质量回退

排障路径

  • queue→prefill→decode→network
  • 分离 TTFT/TPOT
  • 看 batch/KV/显存/并发

实战练习

  • 固定长度矩阵压测
  • 灰度模型版本与自动回滚

验收标准

  • 基准条件完整
  • 质量/成本/延迟同时达标
  • 超载有拒绝/降级

对应优秀开源项目

  • vllm-project/vllm;原链接:https://github.com/vllm-project/vllm
  • triton-inference-server/server;原链接:https://github.com/triton-inference-server/server
  • kserve/kserve;原链接:https://github.com/kserve/kserve

继续拆卡的规则

本页是资料入口。只在形成一个能独立解释、带依据与边界的认识后,提炼为 Concept;故障观察进入 Troubleshooting,满足诊断条件的处置进入 Runbook,真实事件进入 Incident。

来源

查看完整原图节点与备注