#161·starcoder

zero3 DPO starcoder 内存不足

作者: oo0-0-0oo创建于 2024年6月26日更新于 2024年6月26日

当我使用 DPO 来训练 7B starcoder 时,出现了 OOM 错误,我使用了 16 个 A100,使用了 TRL 和变压器,当代码运行到 `AutoModelForCausalLM.from_pretrained` 时,出现了 OOM 错误。但是 qwencoder 没有这个问题。模型结构中是否存在不适合 DPO(直接策略优化)的特殊设置?代码如下:

内容来源: bigcode-project/starcoder