百科.dev
全部条目AI 编程趋势榜开源项目技术资讯提交条目
登录
返回工具页

slime · Issues· 498 开放

在 GitHub 打开

本地同步的开放议题(评论请到 GitHub 查看)

  • #2214

    您的项目位于 StackMap — 一张经精心编制的 AI 堆栈地图

    更新于 2026年9月19日
  • #2388

    [错误] Qwen-VL 补丁绕过 SGLang 令牌 ID 保存,导致多轮 TITO 失败

    bug更新于 2026年9月16日
  • #2387

    [问题] 适应性奖励 KL 控制器是否适合 Slime 的 PPO/RLHF 范围?

    question更新于 2026年9月15日
  • #1761

    [错误] 重新启动 Megatron 计划器,使用 rollout_id 而不是训练步骤

    bug更新于 2026年9月15日
  • #2386

    在 Papers with Code 上验证评估

    更新于 2026年9月14日
  • #2384

    [错误] 将完整的 rollout_routed_experts 数据广播到每个 Megatron 训练等级会导致主机内存不足

    bug更新于 2026年9月14日
  • #2339

    [讨论] 在完全异步训练部署运行期间支持后台评估

    question更新于 2026年9月14日
  • #2370

    [错误] 无论 --save-interval 设置为何种值,在最后一步都会无条件地调用 save_model;最后一次写入优化器状态可能会导致任务失败

    更新于 2026年9月13日
  • #2374

    [错误] 从多轮代理展开的扇出组 (list[list[Sample]]) 中发送的动态采样过滤器发生崩溃

    更新于 2026年9月9日
  • #1136

    [BUG] 稳定训练时出现一半OOM,已开启cp

    更新于 2026年9月8日
  • #1487

    在 8 个 B200 GPU 上完成部署阶段后,训练无限期地挂起,其中 CP=4, TP=2

    更新于 2026年9月6日
  • #200

    UX/意外错误: 在中止的样本中, sample.reward 为 None

    更新于 2026年9月5日
  • #2338

    [问题] realign 使用当前轮的 response 长度进行判断

    question更新于 2026年9月5日
  • #397

    如果我们使用 GRPO,且 args.kl_coef 为非零,是否 KL 计算有误?

    更新于 2026年9月5日
  • #1462

    无法从 'sglang.srt.constants' 导入名称 'GPU_MEMORY_TYPE_CUDA_GRAPH'

    更新于 2026年9月5日