[错误] 在 Qwen3.5-35B-A3B (MoE VLM) 环境下, DPO 训练出现崩溃: TypeError: 期望在参数 0 中以张量形式提供元素 0, 但实际为列表
作者: 579486创建于 2026年8月14日更新于 2026年9月4日
标签bugpending
重现问题
- 我已阅读了以上规则并搜索了现有问题。
系统信息
系统信息 LlamaFactory 版本: 最新主分支 模型: Qwen3.5-35B-A3B (Qwen3_5MoeForConditionalGeneration) 训练阶段: DPO 框架: DeepSpeed ZeRO-3, torchrun 8 个 GPU Python: 3.11 Transformer: 5.2.0
内容来源: hiyouga/LlamaFactory