`finetune` 脚本中的初始和最终评估不会在设备之间累积
作者: mseeger创建于 2025年8月30日更新于 2026年6月13日
标签bug
问题描述 我正在查看 litgpt/finetune/lora.py 和 litgpt/finetune/full.py。在 LoRA 代码中,定期评估 L401-418 会在每个设备上运行 validate,然后通过 all_reduce 累加部分。但是,对于初始评估 L310 和最终评估 L260,这种情况并没有发生。在我看来,这似乎是错误的,损失值将只是在排名 0 的设备上。另一个问题是 L395 中打印的 val_loss 值,但似乎在 L401-418 中从未更新。我很乐意提交一个 PR 来修复所有这些问题,但首先我想确认我是否理解这里的某些问题?
内容来源: Lightning-AI/litgpt