open-r1 · Issues· 340 开放
在 GitHub 打开本地同步的开放议题(评论请到 GitHub 查看)
- #723
开发 AGI 的新方法
更新于 2026年9月7日 - #343
在 SFT 脚本中,如果设置 `packing=false`,分布式训练就会卡死
更新于 2026年3月22日 - #692
RuntimeError: 非单个维度 1 上,张量 a(0) 的大小必须与张量 b(5120) 的大小匹配
更新于 2026年3月13日 - #719
依赖项冲突
更新于 2026年2月27日 - #341
SFT 脚本中的错误
更新于 2026年2月3日 - #715
这个项目中是否有中文版的数据集?
更新于 2025年12月18日 - #710
SFT 软件 训练全程序列模型
更新于 2025年11月10日 - #707
前向奖励始终为 0
更新于 2025年10月24日 - #705
使用 cot sft 时选择检查点
更新于 2025年10月1日 - #704
为什么 grpo 训练时 kl 为 nan?
更新于 2025年9月9日 - #702
对混合思想数据集的许可信息请求
更新于 2025年8月30日 - #403
奖励不是稳步地上升,而是剧烈地波动
更新于 2025年8月20日 - #699
SFT 框架是否支持 DeepSeek-R1-Distill-Qwen-7B 的微调?
更新于 2025年8月18日 - #698
关于评估 AIME24 精度的问题
更新于 2025年8月15日 - #695
vllm 为 LLaMA 添加两个 BOS
更新于 2025年8月6日