[跟踪] 分片 delta 权重同步 (delta_sharded): 规划和已知问题
作者: ChangyiYang创建于 2026年7月16日更新于 2026年9月15日
- 1. FSDP + EP:
Shard(1)/ block-descriptor placement — 已完成,通过 #7144 和 #7085 完成。原始范围:将平滑偏移的Shard(0)快速路径的derive_placement扩展为一个块描述符(local_shape和global_offset,两者都已由compute_local_shape_and_global_offset提供),并包含一个向量化的本地到全局索引转换和密集第一次同步中的块放置。支持 veomni 风格的 FSDP + EP(在 EP 进程中将gate_up_proj分割到 dim0,在 dim1 上将本地专家完全分片)。在 #6974 审查中进行了讨论。 - 2. Megatron 训练器支持(bf16 部署) — 已完成,通过 #7181 完成(2026-07-30,
48ca9eed)(通信模板探针跨 Megatron-Bridge 映射;TP + EP + ETP 包括混合 Mamba;位级验证扫描,235B 8.2–9.7 倍与相同形状的 NCCL)。PP 不在 #7181 的范围内 — 请参阅项目 5。 — mcore 分片导出通过相同的ShardSpec合同:1-D TPDeviceMesh+Shard(partition_dim)+ 纯重排序to_hf转换函数闭包;引擎的转换配置(保持边界的聚集 → NaN 标志重建 →to_hf→ HF 坐标 delta)已在 #6974 中提供。 (已取代工作笔记:https://GitHub.com/ChangyiYang/verl/pull/2)
内容来源: verl-project/verl