百科.dev
全部条目AI 编程趋势榜开源项目技术资讯提交条目
登录
返回工具页

DeepSpec · Issues· 65 开放

在 GitHub 打开

本地同步的开放议题(评论请到 GitHub 查看)

  • #90

    [架构提案] 适用于递归自我改进(RSI)的硬件门控遏制框架(Génesis 协议 V5.0)

    更新于 2026年9月13日
  • #89

    我是否可以为 DeepSeek-v4-flash-0731 进行 dspark 训练?

    更新于 2026年9月13日
  • #86

    我能否为 qwen3.8-flash-next 训练 dspark 呢?

    更新于 2026年9月13日
  • #88

    这个框架目前是否仅支持文档中列出的三个 Qwen3 模型? 是否支持 Qwen3.5 和 Qwen3.6 模型系列的训练? 如果不是,是否有计划在未来添加对这些模型的支持?

    更新于 2026年9月13日
  • #84

    Eagle3 在 ~4.6 个 epoch 后达到峰值,然后开始衰减;此外,它比发布的检查点短了 6%(DSpark/DFlash 可重现)

    更新于 2026年8月24日
  • #83

    DSpark 是否适用于多模态场景,例如 qwen3-vl 模型?

    更新于 2026年8月18日
  • #81

    DSpark 的目标特征选择

    更新于 2026年8月10日
  • #21

    支持在不预先计算目标缓存的情况下进行在线培训

    更新于 2026年8月5日
  • #77

    [脱题] 问题给 Damai Dai / Chengqi Deng: 是否已经探索了基于配置的 MoE 路由?

    更新于 2026年7月31日
  • #76

    [问题] 为什么在论文中实验中, DFlash 比 EAGLE3 对 Gemma4-12B 的性能更差?

    更新于 2026年7月29日
  • #71

    DSpark Qwen3 版本的模型默认忽略 `partial_rotary_factor`, 导致检查点的配置与训练权重不匹配(导致 vLLM 服务出现问题)

    更新于 2026年7月23日
  • #70

    特点:支持针对 LLM 和语音模式的多标记预测 (MTP) 训练

    更新于 2026年7月21日
  • #49

    关于生成范式的远期思考(非 Bug 报告)

    更新于 2026年7月19日
  • #57

    释放用于削减的投机者

    更新于 2026年7月13日
  • #61

    请问DeepSeek官方是否针对新版本模型进行了写作文能力修正?

    更新于 2026年7月10日