[BUG] get_grad_norm_fp32/clip_grad_by_total_norm_fp32 将混合的 bf16/fp32 导数列表传递给一个 TE 多张量启动 -> 非法内存访问 (支持精度的优化器 + 原生 fp32 参数)
作者: linmuchuiyang创建于 2026年9月15日更新于 2026年9月18日
标签community-request
步骤/代码以重现错误
使用 use_precision_aware_optimizer=True、bf16 导出缓冲区(grad_reduce_in_fp32=False、main_grads_dtype=bf16)和默认 clip_grad 的任何模型(例如 DeepSeek-V4 超连接 alpha/bias、ape、attn_sink 具有原生 fp32 参数)。在后向传播后的第一次调用 get_grad_norm_fp32 会崩溃。详细信息如下。
内容来源: NVIDIA/Megatron-LM