SFT 继承了基础检查点中的预批量缩放学习率
作者: Qwertyemma创建于 2026年9月3日更新于 2026年9月9日
我注意到一个可能的问题是,学习率如何从基础训练传递到 SFT 中。在 base_train.py 中,学习率在传递给 model.setup_optimizer() 之前,先通过 batch_lr_scale 进行缩放:
unembedding_lr = args.unembedding_lr * batch_lr_scale, embedding_lr = args.embedding_lr * batch_lr_scale, scalar_lr = args.scalar_lr * batch_lr_scale, matrix_lr = args.matrix_lr * batch_lr_scale,
内容来源: karpathy/nanochat