OpenRLHF · Issues· 381 开放
在 GitHub 打开本地同步的开放议题(评论请到 GitHub 查看)
- #1358
make_experience 中的非最优前向调度顺序导致了不必要的序列化
更新于 2026年9月18日 - #1349
LoRA + 共置 vLLM: 策略 → vLLM 权重同步失败 (dtype,然后是未映射的适配器名称)
更新于 2026年9月14日 - #1317
奖励模型 HTTP 服务不具有身份验证,默认为绑定所有接口,训练客户端会消耗端点返回的所有内容。
更新于 2026年9月9日 - #1322
[错误] 异步超采样检查点在恢复时丢弃缓冲的展开
更新于 2026年9月4日 - #1311
[错误] RewardDataset 在截断后默默保留变成相同的偏好项对
更新于 2026年8月21日 - #1303
[路线图] Intel XPU 上的 OpenRLHF
更新于 2026年8月12日 - #1295
[错误] seq-mask-tis 会跳过 token 层级的截断,可能产生无限大的 PPO 更新
更新于 2026年8月8日 - #1011
assert "expandable_segments:True" not in conf 发生错误
更新于 2026年7月27日 - #1273
Molt 为 OpenRLHF 引入了基于 Automodel 的后端 (AutoTP/EP/CP)
更新于 2026年7月27日 - #1270
在使用非二元奖励时,降权经验也应考虑标准差。
更新于 2026年7月25日 - #1263
功能请求: 在 PPO/GRPO 训练期间监控奖励黑客行为的触发点
更新于 2026年7月12日 - #1164
修复 SignalActor 并发问题,并重新设计基于条件锁的状态管理
更新于 2026年7月9日 - #1243
overlong_penalty 应将工具响应令牌排除在长度计算之外(使用 action_mask/action_ranges)
更新于 2026年6月18日 - #1244
可以考虑通过 `kernels` 使用预先构建的 Flash Attention 内核
更新于 2026年5月28日 - #1236
多节点训练的光线误差
更新于 2026年5月13日