百科.dev
全部条目AI 编程趋势榜开源项目技术资讯提交条目
登录
返回工具页

OpenRLHF · Issues· 381 开放

在 GitHub 打开

本地同步的开放议题(评论请到 GitHub 查看)

  • #1358

    make_experience 中的非最优前向调度顺序导致了不必要的序列化

    更新于 2026年9月18日
  • #1349

    LoRA + 共置 vLLM: 策略 → vLLM 权重同步失败 (dtype,然后是未映射的适配器名称)

    更新于 2026年9月14日
  • #1317

    奖励模型 HTTP 服务不具有身份验证,默认为绑定所有接口,训练客户端会消耗端点返回的所有内容。

    更新于 2026年9月9日
  • #1322

    [错误] 异步超采样检查点在恢复时丢弃缓冲的展开

    更新于 2026年9月4日
  • #1311

    [错误] RewardDataset 在截断后默默保留变成相同的偏好项对

    更新于 2026年8月21日
  • #1303

    [路线图] Intel XPU 上的 OpenRLHF

    更新于 2026年8月12日
  • #1295

    [错误] seq-mask-tis 会跳过 token 层级的截断,可能产生无限大的 PPO 更新

    更新于 2026年8月8日
  • #1011

    assert "expandable_segments:True" not in conf 发生错误

    更新于 2026年7月27日
  • #1273

    Molt 为 OpenRLHF 引入了基于 Automodel 的后端 (AutoTP/EP/CP)

    更新于 2026年7月27日
  • #1270

    在使用非二元奖励时,降权经验也应考虑标准差。

    更新于 2026年7月25日
  • #1263

    功能请求: 在 PPO/GRPO 训练期间监控奖励黑客行为的触发点

    更新于 2026年7月12日
  • #1164

    修复 SignalActor 并发问题,并重新设计基于条件锁的状态管理

    更新于 2026年7月9日
  • #1243

    overlong_penalty 应将工具响应令牌排除在长度计算之外(使用 action_mask/action_ranges)

    更新于 2026年6月18日
  • #1244

    可以考虑通过 `kernels` 使用预先构建的 Flash Attention 内核

    更新于 2026年5月28日
  • #1236

    多节点训练的光线误差

    更新于 2026年5月13日