百科.dev
全部条目AI 编程趋势榜开源项目技术资讯提交条目
登录
返回工具页

verl · Issues· 1228 开放

在 GitHub 打开

本地同步的开放议题(评论请到 GitHub 查看)

  • #5192

    Google TPU 在使用 Ray 时的支持

    更新于 2026年9月18日
  • #7914

    [megatron] 后- 意- 意- 意- 意的后卫拒绝 CP=1 , 似乎对重建的 THD 输出有过多的限制

    更新于 2026年9月18日
  • #7913

    [错误] 当将一个 minibatch 分割成多个 microbatch 时, GMPO geo_mean 损失会发生变化

    bug更新于 2026年9月18日
  • #6280

    在策略一致性设置中,rollout 和 actor 每个 GPU 的微批量不同时,`log_prob` 和 `old_log_prob` 会不同

    更新于 2026年9月18日
  • #7909

    多 LoRA 训练: 在一个基础模型上使用驻留适配器和混合适配器步骤

    更新于 2026年9月17日
  • #7904

    [rollout][vllm] 当 `free_cache_engine=true` 时,权重同步后的多语言输出会变得混乱(睡眠/恢复会破坏 rollout 权重)

    bug更新于 2026年9月17日
  • #7899

    [错误] 长度相等的 3D mRoPE 位置 ID 产生不一致的锯齿布局 → V1 训练器中的 split_with_sizes 发生崩溃

    更新于 2026年9月17日
  • #7060

    [跟踪] 分片 delta 权重同步 (delta_sharded): 规划和已知问题

    更新于 2026年9月15日
  • #6252

    Qwen3.5/Qwen3.6 35B-A3B 多轮工具调用时,Agent RL 训练中出现工具调用格式异常,导致崩溃

    更新于 2026年9月14日
  • #7798

    [错误] Qwen 3.5 系统专用提示仍然无法通过连续令牌

    更新于 2026年9月14日
  • #7856

    [RFC] 具备尾部信息的 on-policy 精馏的 top-k KL

    更新于 2026年9月13日
  • #7839

    [RFC]增强型'verl.single-controller':后端中性工人组运行时间

    更新于 2026年9月11日
  • #7834

    [fsdp] 绑定嵌入禁用仅在 rank0 上加载权重,因此主机 RAM 会随着 rank 个数而扩展; 简单的修复会在不显示任何提示的情况下解除模型绑定

    更新于 2026年9月10日
  • #7829

    [错误] 随着 PPO 微批量大小的变化, KL-Cov 令牌选择也会发生变化

    bug更新于 2026年9月10日
  • #7824

    [data] val_max_samples 会从 data.shuffle 中抽样,因此 data.validation_shuffle 从来不会到达它。

    更新于 2026年9月10日