#7060·verl

[跟踪] 分片 delta 权重同步 (delta_sharded): 规划和已知问题

作者: ChangyiYang创建于 2026年7月16日更新于 2026年9月15日
  • 1. FSDP + EP: Shard(1) / block-descriptor placement — 已完成,通过 #7144 和 #7085 完成。原始范围:将平滑偏移的 Shard(0) 快速路径的 derive_placement 扩展为一个块描述符(local_shapeglobal_offset,两者都已由 compute_local_shape_and_global_offset 提供),并包含一个向量化的本地到全局索引转换和密集第一次同步中的块放置。支持 veomni 风格的 FSDP + EP(在 EP 进程中将 gate_up_proj 分割到 dim0,在 dim1 上将本地专家完全分片)。在 #6974 审查中进行了讨论。
  • 2. Megatron 训练器支持(bf16 部署) — 已完成,通过 #7181 完成(2026-07-30,48ca9eed)(通信模板探针跨 Megatron-Bridge 映射;TP + EP + ETP 包括混合 Mamba;位级验证扫描,235B 8.2–9.7 倍与相同形状的 NCCL)。PP 不在 #7181 的范围内 — 请参阅项目 5。 — mcore 分片导出通过相同的 ShardSpec 合同:1-D TP DeviceMesh + Shard(partition_dim) + 纯重排序 to_hf 转换函数闭包;引擎的转换配置(保持边界的聚集 → NaN 标志重建 → to_hf → HF 坐标 delta)已在 #6974 中提供。 (已取代工作笔记:https://GitHub.com/ChangyiYang/verl/pull/2)

内容来源: verl-project/verl