不同的Transformer在训练时损失了尖锐.
作者: fasil-saidalavi创建于 2025年5月20日更新于 2026年1月25日
我已经训练了1.3B型机车 使用不同型号的Transformer 和标准型的Transformer. 我注意到,LLM对不同变体的评价分数略有改善,其损失一直较低。 然而,当我尝试了7B模型比较时,训练显示损失猛增,损失在某一点后开始增加. 我还注意到,在损失猛增的同点,梯度标准也有所增加。 在执行细节方面,我只使用了这个储存库的差别注意部分;我不包括SwiGLU层。 相反,我用了标准的FFN层. @ YTianZHU (中文(简体) )
内容来源: microsoft/unilm