nanochat · Issues· 120 开放
在 GitHub 打开本地同步的开放议题(评论请到 GitHub 查看)
- #848
SFT 继承了基础检查点中的预批量缩放学习率
更新于 2026年9月9日 - #844
多种因果泄漏架构可将 NanoChat val_bpb 降低到 0.0018
更新于 2026年9月1日 - #840
tasks/common.py 中的 TaskSequence 未被使用
更新于 2026年8月28日 - #838
"峰值内存使用量"在 CPU 和 MPS 上报告为 0.00MiB
更新于 2026年8月28日 - #590
[错误] scripts/chat_sft.py 在小设备批量大小(≤ 8)下,从步骤 00001 开始产生损失:nan,原因是完全掩码的微批量
code robustness更新于 2026年8月26日 - #810
chat_rl: 采样的 assistant_end 标记被掩藏,因此永远不会进行强化
potential_bug更新于 2026年8月24日 - #825
SDPA 回退: 滑动窗口不会减少内存(无论窗口大小如何,都会构建完整的掩码)
更新于 2026年8月9日 - #698
RTX 3050TI 未检测到 m.get_device()
更新于 2026年8月4日 - #737
使用官方 PyTorch FA3 版本
更新于 2026年8月2日 - #820
FA3 装载程序在 Blackwell (sm_120) 上报成功,然后在首次启动内核时崩溃
更新于 2026年8月2日 - #756
令牌混淆无法正确处理分块预填/分块推断(分块的第一个令牌未能找到其跨分块的前驱)
potential_bug更新于 2026年7月31日 - #284
是否添加对 TPU 的支持?
feature更新于 2026年7月26日 - #804
添加对 OpenCL (例如, 对集成 AMD GPU) 的支持 ?
更新于 2026年7月10日 - #791
待做: 为 d34 模型计算哈希值
docs更新于 2026年6月26日 - #427
base_eval.py: hellaswag 在小型模型上逐渐变慢并泄露内存 (Mac Studio)
performance更新于 2026年6月3日