slime · Issues· 498 开放
在 GitHub 打开本地同步的开放议题(评论请到 GitHub 查看)
- #2214
您的项目位于 StackMap — 一张经精心编制的 AI 堆栈地图
更新于 2026年9月19日 - #2388
[错误] Qwen-VL 补丁绕过 SGLang 令牌 ID 保存,导致多轮 TITO 失败
bug更新于 2026年9月16日 - #2387
[问题] 适应性奖励 KL 控制器是否适合 Slime 的 PPO/RLHF 范围?
question更新于 2026年9月15日 - #1761
[错误] 重新启动 Megatron 计划器,使用 rollout_id 而不是训练步骤
bug更新于 2026年9月15日 - #2386
在 Papers with Code 上验证评估
更新于 2026年9月14日 - #2384
[错误] 将完整的 rollout_routed_experts 数据广播到每个 Megatron 训练等级会导致主机内存不足
bug更新于 2026年9月14日 - #2339
[讨论] 在完全异步训练部署运行期间支持后台评估
question更新于 2026年9月14日 - #2370
[错误] 无论 --save-interval 设置为何种值,在最后一步都会无条件地调用 save_model;最后一次写入优化器状态可能会导致任务失败
更新于 2026年9月13日 - #2374
[错误] 从多轮代理展开的扇出组 (list[list[Sample]]) 中发送的动态采样过滤器发生崩溃
更新于 2026年9月9日 - #1136
[BUG] 稳定训练时出现一半OOM,已开启cp
更新于 2026年9月8日 - #1487
在 8 个 B200 GPU 上完成部署阶段后,训练无限期地挂起,其中 CP=4, TP=2
更新于 2026年9月6日 - #200
UX/意外错误: 在中止的样本中, sample.reward 为 None
更新于 2026年9月5日 - #2338
[问题] realign 使用当前轮的 response 长度进行判断
question更新于 2026年9月5日 - #397
如果我们使用 GRPO,且 args.kl_coef 为非零,是否 KL 计算有误?
更新于 2026年9月5日 - #1462
无法从 'sglang.srt.constants' 导入名称 'GPU_MEMORY_TYPE_CUDA_GRAPH'
更新于 2026年9月5日