[特性] DeepSeek-V4 MoE 仅通过 DeepGEMM 使用 Blackwell - 是否需要非 Blackwell 路径?
作者: Hakureirm创建于 2026年8月4日更新于 2026年9月1日
现状和动机
DeepSeek-V4 目前只在 PyTorch 引擎中支持一个 MoE 路径: DeepseekV4MoE 无条件地构建 FusedMoEV4FP4 (lmdeploy/pytorch/models/deepseek_v4.py:633), 该路径最终会解析为 TritonFusedMoEV4FP4Builder,并最终导致 DeepGEMM 的 m_grouped_fp8_fp4_gemm_nt_contiguous。该内核只在 arch_major == 10 时接受打包的 FP4 专家权重,正如实现的文档中指出的那样 — 因此模型实际上只支持 Blackwell,甚至 SM90 也被排除在外。
这是一个合理的起点,但它忽略了这个生态系统中大多数自主部署的硬件。它还与 LMDeploy 自己的旧 GPU 立场相距甚远:TurboMind 的 MXFP4 支持宣传为在“NVIDIA GPU 从 V100 开始”工作。模型文件本身没有架构门控;限制完全存在于选择哪个 MoE 实现中。
我想知道 DeepSeek-V4 是否有非 Blackwell 的 MoE 路径。如果是,我可以帮助完成通常最难安排的部分 — 真实的硬件和测量。
内容来源: InternLM/lmdeploy