#303·nanoGPT

在从 OWT 训练 GPT-2 时出现训练/验证损失问题

作者: JustinKunzi创建于 2023年6月17日更新于 2026年5月2日

目前我正在测试一个由 4 个 NVIDIA A4500 组成的新系统,没有遇到运行 Shakespeare 训练集的问题,结果如预期。我的系统目前正在使用 OWT 数据集训练 GPT 124M 模型,一切似乎都很顺利,直到第 20 步左右,我们的损失值开始增加,直到达到 ~7.81,此后一直在 ~0.5 的值附近徘徊,大约有 65 步。检查 readme 中的损失图表发现情况非常不寻常,可能表明存在某种问题。有什么想法吗?以下是为了高效利用更多 VRAM 以减少总训练时间而做出的配置更改。

内容来源: karpathy/nanoGPT