#810·nanochat

chat_rl: 采样的 assistant_end 标记被掩藏,因此永远不会进行强化

作者: devYRPauli创建于 2026年7月20日更新于 2026年8月24日
标签potential_bug

在 RL 训练中,模型从来没有获得停止决策的梯度,因为实际采样的 `<|assistant_end|>` 标记被丢弃,然后以填充的方式重新插入。`Engine.generate_batch`(`nanochat/engine.py:288-294`)标记了在终止标记上完成的行,但不会附加该标记或其掩码:

内容来源: karpathy/nanochat