百科.dev
全部条目AI 编程趋势榜开源项目技术资讯提交条目
登录
返回工具页

trl · Issues· 284 开放

在 GitHub 打开

本地同步的开放议题(评论请到 GitHub 查看)

  • #7270

    [错误] 使用 use_liger_kernel=True 的 GMPOTrainer 会在 GRPO 目标上进行训练

    更新于 2026年9月18日
  • #7268

    SFTtrainer 的 QLORA fp16 下播也点击了 QDoRA 星等向量, 导致无声无声的更新

    更新于 2026年9月18日
  • #6808

    GMPO: use_liger_kernel=True 会默默地绕过 GMPO 损失; MoE 辅助损失和熵奖励被删除(缺口未被 #6095 覆盖)

    更新于 2026年9月18日
  • #6789

    GRPO: 当 top_p/top_k/min_p 截断采样时,vLLM 重要性采样比例会偏差

    更新于 2026年9月18日
  • #7244

    用于损失头的融合 Triton 内核

    更新于 2026年9月17日
  • #7063

    [追踪] 关闭 liger- 内核, 让内存效率损失成为默认值

    更新于 2026年9月17日
  • #7222

    在不包含 output_router_logits 的 MoE 配置中, router_aux_loss_coef 将被默认忽略

    更新于 2026年9月17日
  • #7202

    审计没有生成脚本的 trl 内部测试重置程序

    更新于 2026年9月17日
  • #7137

    将微小的测试模型配置与其参考模型进行对齐

    更新于 2026年9月17日
  • #7182

    [RFC] 从 `trl.experimental` 中删除代码的标准

    更新于 2026年9月17日
  • #7245

    当 use_liger_kernel=True 时, DPO 和 KTO 会跳过 DDP 梯度同步

    更新于 2026年9月16日
  • #7015

    get_repetition_penalty_reward 接受非正整数的 ngram_size

    更新于 2026年9月16日
  • #7220

    苹果硅 (MPS): 在装入 bf16 检查点时, 创建 model from path 时可以 segfault

    更新于 2026年9月15日
  • #6981

    [错误] get_dataset 对于零和分数引发 ZeroDivisionError

    更新于 2026年9月15日
  • #6151

    在 DistillationTrainer 中支持基于路由器的多教师 (MOPD) 精炼

    更新于 2026年9月15日