#848·nanochat

SFT 继承了基础检查点中的预批量缩放学习率

作者: Qwertyemma创建于 2026年9月3日更新于 2026年9月9日

我注意到一个可能的问题是,学习率如何从基础训练传递到 SFT 中。在 base_train.py 中,学习率在传递给 model.setup_optimizer() 之前,先通过 batch_lr_scale 进行缩放:

unembedding_lr = args.unembedding_lr * batch_lr_scale, embedding_lr = args.embedding_lr * batch_lr_scale, scalar_lr = args.scalar_lr * batch_lr_scale, matrix_lr = args.matrix_lr * batch_lr_scale,

内容来源: karpathy/nanochat