量化模型显存估算的边界
对 2026 年 3 月有道笔记的估算规则做算术核查。源文没有固定模型修订、量化文件、推理框架版本、上下文长度和并发数;其中显卡推荐及容量表均不能作为部署承诺。
先区分权重下界与服务显存
若参数量为 P 十亿、每参数恰占 b bit,仅权重数据的十进制理论容量为 P × b ÷ 8 GB。对应每十亿参数,FP16 是 2 GB、INT8 是 1 GB、INT4 是 0.5 GB。因此 FP16 与 INT8 分别约为原始 INT4 载荷的 4 倍与 2 倍;原文所写“约 2 倍”“约 1 倍”不符合这组公式。
这些是理想化下界,不是 Q4 文件或运行时占用。分组量化的 scale、zero point、未量化层、框架工作区、CUDA 上下文和碎片都会增加占用;KV cache 还受层数、KV 头数、精度、上下文长度、批量及并发影响。原文统一预留 1–2 GB 没有可迁移的适用条件。
用来源中的模型检查表格
- 对源文列出的 Qwen3-30B-A3B,
A3B表示单次推理的激活参数规模,不能把驻留权重直接按 3B 估算。按 30B 总参数与原始 INT4 算术,下界约 15 GB;源文给出的 Q4 约 17 GB 只是未注明量化格式和模型修订的估计,仍需读实际模型文件并测量。 - 原文的通用表称 14B FP16 可落在 16 GB 显存档。按其自身公式,仅 14B 参数的 FP16 权重下界就约 28 GB,尚未计入运行时与 KV cache。这一档位建议不能用于选卡。
MoE 的激活参数规模主要影响每 token 的计算量;若要求所有专家常驻 GPU,显存应按全部驻留权重估算。若采用 CPU 卸载或多卡切分,则需另测传输、分片与吞吐,不能把单卡容量简单相加视作性能结论。
待核查
- 固定模型仓库修订、具体量化文件与格式,以及推理框架和版本,记录实际权重大小与加载后的空载显存。
- 用目标提示长度、输出长度、并发和批量测显存峰值、KV cache、首 token 与后续 token 延迟;多模态模型另计视觉输入规模。
- 对照目标 GPU 的计算能力、可用显存与多卡互连,再决定能否运行及是否满足服务容量。源文各型号“最低显存”和“推荐显卡”未经过这一步验证。
关联
模型推理服务与容量提供服务容量的更广框架;Qwen2.5-VL 在 V100 上的兼容性线索展示视觉输入与版本如何改变实测边界。