DeepSpeedExamples · Issues· 330 开放
在 GitHub 打开本地同步的开放议题(评论请到 GitHub 查看)
- #996
PPO 中的 Compute_rewards:rewards[j, start:ends[j]][-1] += reward_clip[j] 存在错误
更新于 2025年12月22日 - #995
当我运行 "bash training_scripts/opt/single_gpu/run_1.3b.sh" 时,步骤 1 失败
更新于 2025年12月16日 - #989
一个示例,多个配置文件
更新于 2025年9月8日 - #703
如何理解计算奖励的代码
更新于 2025年8月28日 - #984
moe 示例 404
更新于 2025年7月25日 - #186
尽管 ZeRO 阶段 3 仍出现 OOM
更新于 2025年7月23日 - #979
可以包含 DeepNVMe + 状态字典的示例
更新于 2025年6月20日 - #943
KV_cache 分担负载
更新于 2025年6月12日 - #172
我的 deepspeed 代码运行速度非常慢
更新于 2025年6月2日 - #956
为什么 vf_loss 取最大值,导致 clamp 失效?
更新于 2025年5月17日 - #969
应用 Zero-3 后,LoRA 显示为空 lora 权重 [0]
更新于 2025年5月11日 - #845
torch.distributed.DistBackendError: NCCL 在 ../torch/csrc/distributed/c10d/ProcessGroupNCCL.cpp:1333 处出错,远程进程退出或发生网络错误, NCCL 版本 2.18.6
更新于 2025年4月24日 - #960
DeepSpeed-FastGen 是否支持 ascend npu?
更新于 2025年4月7日 - #892
Zero-Inference 是否支持 TP?
更新于 2025年3月21日 - #946
断言 `srcIndex < srcSelectDimSize` 失败
更新于 2025年1月24日