[BUG] get_grad_norm_fp32/clip_grad_by_total_norm_fp32 将混合的 bf16/fp32 导数列表传递给一个 TE 多张量启动 -> 非法内存访问 (支持精度的优化器 + 原生 fp32 参数)

作者: linmuchuiyang创建于 2026年9月15日更新于 2026年9月18日
标签community-request

步骤/代码以重现错误

使用 use_precision_aware_optimizer=True、bf16 导出缓冲区(grad_reduce_in_fp32=Falsemain_grads_dtype=bf16)和默认 clip_grad 的任何模型(例如 DeepSeek-V4 超连接 alpha/bias、apeattn_sink 具有原生 fp32 参数)。在后向传播后的第一次调用 get_grad_norm_fp32 会崩溃。详细信息如下。

内容来源: NVIDIA/Megatron-LM