预训练损失爆炸
作者: mattgorb创建于 2024年9月13日更新于 2026年5月2日
我已经试了几个月,但我的损失总是在 30k 到 100k 次迭代之间爆炸。 我尝试了很多东西: 关闭闪光注意力(基于这个问题:https://GitHub.com/karpathy/nanoGPT/issues/524) 使用 fp16(基于这个:https://GitHub.com/karpathy/nanoGPT/issues/468) 使用 GPT-4 标记器(基于 https://GitHub.com/karpathy/nanoGPT/issues/468) 起初损失会回升到大约 8-10,现在使用 fp16 后就变成了 NaN。 我也尝试了其他设置,如梯度裁剪、学习率等。 我将配置保持在大约 500k 批量大小。 我不知道接下来应该尝试什么。 还有其他人解决了这个问题吗? 我已经将 GPT-2 Small 降到了大约 3.0 的损失。
内容来源: karpathy/nanoGPT