ms-swift · Issues· 592 开放
在 GitHub 打开本地同步的开放议题(评论请到 GitHub 查看)
- #9051
A800通信问题。两张卡,一张用于启动vllm,一张用于训练,无法连接到vllm,是否存在通信问题?
questionstale更新于 2026年9月18日 - #10189
[错误] Qwen3.5 MoE 多模 DPO 丢失了输出_router_logits 并崩溃,aux_loss 为 None
更新于 2026年9月17日 - #9123
2 个节点 sft Qwen3.5-35B-A3B 错误 FlashAttnVarlenFunc.apply ValueError: basic_string::_M_create
bugstale更新于 2026年9月17日 - #9593
如何重构 dataset 的默认 getitem 函数
question更新于 2026年9月16日 - #10057
关于 qwen3.5 mtp sft、多模态数据
question更新于 2026年9月16日 - #10156
[错误] 在 beta=0.5 时, Megatron GKD 中的 JSD 损失为负数; 同样的输入, FP32 则给出了正数结果
bug更新于 2026年9月16日 - #9064
如何设置 gemma-4 图像的最大 token 数量
questionstale更新于 2026年9月16日 - #9357
[错误] Qwen2.5-VL 在 transformers v5 上无法推理视频
bugstale更新于 2026年9月16日 - #10108
优化 npu_swiglu_forward: 使用拼接投影权重而不是拼接激活,以减少内存并提高 NPU 性能
question更新于 2026年9月15日 - #10124
正确调整 NPU 环境中的 qwen3-embedding
question更新于 2026年9月15日 - #9390
在Ascend 910B 上使用 swift sft 训练 Qwen3.5 9B 时出现 accelerate 错误
bugstale更新于 2026年9月15日 - #9561
如何使用 Python 训练 Qwen3 VL 嵌入?
questionstale更新于 2026年9月15日 - #9576
请问 seq_cls 分类任务 lora 训练如何加速推理?
questionstale更新于 2026年9月15日 - #10117
[RLHF] DAPO/CISPO/FIPO 的损失在梯度累积时被额外除以 gradient_accumulation_steps
更新于 2026年9月14日 - #9556
如何运行 Qwen3.5 9B GRPO GSM8K
questionstale更新于 2026年9月14日