BeamModel

Beam 显存计算器

Beam 总参数 501B,每个 token 只激活 23B,因此推理速度快,但全部专家权重仍需载入内存。选择权重格式和上下文长度即可估算占用。

权重
–
KV cache
–
运行时开销(约 5%)
–
估算总计
–

所需设备数量

设备数量

KV cache 数值在 Reflection AI 公布模型配置(层数、注意力结构)之前只是假设值,可在上方修改。设备数量按每台设备约 90% 内存可用计算,未考虑互联带宽限制。