verl · Issues· 1228 开放
在 GitHub 打开本地同步的开放议题(评论请到 GitHub 查看)
- #5192
Google TPU 在使用 Ray 时的支持
更新于 2026年9月18日 - #7914
[megatron] 后- 意- 意- 意- 意的后卫拒绝 CP=1 , 似乎对重建的 THD 输出有过多的限制
更新于 2026年9月18日 - #7913
[错误] 当将一个 minibatch 分割成多个 microbatch 时, GMPO geo_mean 损失会发生变化
bug更新于 2026年9月18日 - #6280
在策略一致性设置中,rollout 和 actor 每个 GPU 的微批量不同时,`log_prob` 和 `old_log_prob` 会不同
更新于 2026年9月18日 - #7909
多 LoRA 训练: 在一个基础模型上使用驻留适配器和混合适配器步骤
更新于 2026年9月17日 - #7904
[rollout][vllm] 当 `free_cache_engine=true` 时,权重同步后的多语言输出会变得混乱(睡眠/恢复会破坏 rollout 权重)
bug更新于 2026年9月17日 - #7899
[错误] 长度相等的 3D mRoPE 位置 ID 产生不一致的锯齿布局 → V1 训练器中的 split_with_sizes 发生崩溃
更新于 2026年9月17日 - #7060
[跟踪] 分片 delta 权重同步 (delta_sharded): 规划和已知问题
更新于 2026年9月15日 - #6252
Qwen3.5/Qwen3.6 35B-A3B 多轮工具调用时,Agent RL 训练中出现工具调用格式异常,导致崩溃
更新于 2026年9月14日 - #7798
[错误] Qwen 3.5 系统专用提示仍然无法通过连续令牌
更新于 2026年9月14日 - #7856
[RFC] 具备尾部信息的 on-policy 精馏的 top-k KL
更新于 2026年9月13日 - #7839
[RFC]增强型'verl.single-controller':后端中性工人组运行时间
更新于 2026年9月11日 - #7834
[fsdp] 绑定嵌入禁用仅在 rank0 上加载权重,因此主机 RAM 会随着 rank 个数而扩展; 简单的修复会在不显示任何提示的情况下解除模型绑定
更新于 2026年9月10日 - #7829
[错误] 随着 PPO 微批量大小的变化, KL-Cov 令牌选择也会发生变化
bug更新于 2026年9月10日 - #7824
[data] val_max_samples 会从 data.shuffle 中抽样,因此 data.validation_shuffle 从来不会到达它。
更新于 2026年9月10日