模块资料|模型推理服务与容量
原图深度模块的结构化资料摘录,保留目标、知识、命令线索、风险、排障、练习与验收。它不是一张原子知识卡,也不是可直接执行的操作手册。
所属方向:AI Infra。
目标
- 运营低延迟、高吞吐、可回滚的模型服务。
知识拆解
- prefill/decode
- KV cache
- continuous batching
- quantization
- tensor parallel
- TTFT/TPOT
- queue/autoscaling
命令 / 配置 / 关键对象
以下是原图中的命令名、缩写或配置对象,并非经校验的完整命令行;其中可能含写操作。执行前必须补齐版本、权限、目标和风险。
- vLLM/Triton/KServe
- OpenAI-compatible endpoint
- load test
- GPU metrics
- model registry
高频故障与风险
- OOM
- 长队列
- 尾延迟
- 模型加载慢
- 上下文过长
- 量化质量回退
排障路径
- queue→prefill→decode→network
- 分离 TTFT/TPOT
- 看 batch/KV/显存/并发
实战练习
- 固定长度矩阵压测
- 灰度模型版本与自动回滚
验收标准
- 基准条件完整
- 质量/成本/延迟同时达标
- 超载有拒绝/降级
对应优秀开源项目
- vllm-project/vllm;原链接:
https://github.com/vllm-project/vllm - triton-inference-server/server;原链接:
https://github.com/triton-inference-server/server - kserve/kserve;原链接:
https://github.com/kserve/kserve
继续拆卡的规则
本页是资料入口。只在形成一个能独立解释、带依据与边界的认识后,提炼为 Concept;故障观察进入 Troubleshooting,满足诊断条件的处置进入 Runbook,真实事件进入 Incident。