DeepSpec · Issues· 65 开放
在 GitHub 打开本地同步的开放议题(评论请到 GitHub 查看)
- #90
[架构提案] 适用于递归自我改进(RSI)的硬件门控遏制框架(Génesis 协议 V5.0)
更新于 2026年9月13日 - #89
我是否可以为 DeepSeek-v4-flash-0731 进行 dspark 训练?
更新于 2026年9月13日 - #86
我能否为 qwen3.8-flash-next 训练 dspark 呢?
更新于 2026年9月13日 - #88
这个框架目前是否仅支持文档中列出的三个 Qwen3 模型? 是否支持 Qwen3.5 和 Qwen3.6 模型系列的训练? 如果不是,是否有计划在未来添加对这些模型的支持?
更新于 2026年9月13日 - #84
Eagle3 在 ~4.6 个 epoch 后达到峰值,然后开始衰减;此外,它比发布的检查点短了 6%(DSpark/DFlash 可重现)
更新于 2026年8月24日 - #83
DSpark 是否适用于多模态场景,例如 qwen3-vl 模型?
更新于 2026年8月18日 - #81
DSpark 的目标特征选择
更新于 2026年8月10日 - #21
支持在不预先计算目标缓存的情况下进行在线培训
更新于 2026年8月5日 - #77
[脱题] 问题给 Damai Dai / Chengqi Deng: 是否已经探索了基于配置的 MoE 路由?
更新于 2026年7月31日 - #76
[问题] 为什么在论文中实验中, DFlash 比 EAGLE3 对 Gemma4-12B 的性能更差?
更新于 2026年7月29日 - #71
DSpark Qwen3 版本的模型默认忽略 `partial_rotary_factor`, 导致检查点的配置与训练权重不匹配(导致 vLLM 服务出现问题)
更新于 2026年7月23日 - #70
特点:支持针对 LLM 和语音模式的多标记预测 (MTP) 训练
更新于 2026年7月21日 - #49
关于生成范式的远期思考(非 Bug 报告)
更新于 2026年7月19日 - #57
释放用于削减的投机者
更新于 2026年7月13日 - #61
请问DeepSeek官方是否针对新版本模型进行了写作文能力修正?
更新于 2026年7月10日