Megatron-LM · Issues· 1371 开放
在 GitHub 打开本地同步的开放议题(评论请到 GitHub 查看)
- #7171
[功能请求] 为 HybridModel 训练添加 Engram 存储
enhancementcommunity-requestwaiting-on-customer更新于 2026年9月18日 - #6757
[路线图][2026 年第三季度]Megatron Core MoE 路线图
call for contribution更新于 2026年9月18日 - #7484
[推理] 为推理优化的 MoE 拒绝使用专家张量并行化,且没有回归覆盖
community-request更新于 2026年9月18日 - #7452
Megatron Core 并行组合中静默的数值正确性错误
community-request更新于 2026年9月18日 - #7174
[BUG] 仅使用一个数据集时,完整验证失败
community-request更新于 2026年9月18日 - #7173
[BUG] 计划程序覆盖会覆盖每组的 LR 限值
community-request更新于 2026年9月18日 - #7172
[BUG] 具有 MoE 的混合 MTP1 在丢失日志记录期间发生故障
community-request更新于 2026年9月18日 - #6872
Kimi-K3 训练支持
enhancement更新于 2026年9月18日 - #5676
[路线图][2026 年第三季度] Megatron Core 路线图
call for contribution更新于 2026年9月18日 - #4167
功能请求: ScatterMoE (基于 Triton 的稀疏 MoE,具有融合的散列/聚集 GEMM)
enhancement更新于 2026年9月18日 - #7475
`current_max_attn_logits` 会导致 CUDA 图形回放失败,因为其 Python 级别的赋值没有重新执行
bugcommunity-request更新于 2026年9月18日 - #4468
DeepSeek-V4 训练支持
enhancement更新于 2026年9月18日 - #7338
[BUG] get_grad_norm_fp32/clip_grad_by_total_norm_fp32 将混合的 bf16/fp32 导数列表传递给一个 TE 多张量启动 -> 非法内存访问 (支持精度的优化器 + 原生 fp32 参数)
community-request更新于 2026年9月18日 - #7389
[BUG] 共享专家重叠导致独立专家的 wgrad 等待到输入梯度合并
community-requestwaiting-on-maintainers更新于 2026年9月18日 - #7464
[错误] 词汇对应标签平滑使用本地词汇量和本地平均对数概率
bugcommunity-request更新于 2026年9月18日