模型显存与并发容量计算器¶
先用估算筛掉明显不可行的组合,再用目标引擎实测。计算器不能精确包含量化元数据、临时 Workspace、CUDA Graph、碎片、MoE 激活专家和引擎版本差异。
1. 基础公式¶
权重 GiB ≈ 参数量 × 每参数字节 / 2^30
可用显存 ≈ GPU 数 × 单卡显存 × (1 - 运行时预留比例)
KV 预算 ≈ 可用显存 - 权重 - 其他常驻开销
理论并发 ≈ floor(KV 预算 / 单请求 KV Cache)
BF16/FP16 权重大约使用 2 Bytes/参数,但总显存绝不等于权重大小。量化还会引入 Scale、Zero Point、打包格式和 Kernel Workspace。训练还需计算梯度、优化器状态和激活,不能使用这个推理计算器。
2. 单请求 KV Cache¶
KV Cache 与层数、KV Head、Head Dimension、精度、输入长度、已生成长度和并行切分有关。最可靠的方法是在目标引擎中固定一个请求长度,读取引擎指标或显存增量,再填入计算器。
3. 成本计算器¶
结果只包含 GPU 时间。生产成本还应加入 CPU、内存、存储、模型分发、网络、空闲冗余、日志、控制面和工程支持。