由于 param groups 中缺少 lr 参数,因此未正确应用分层式学习率衰减 (lrd)
作者: xujialiu创建于 2025年3月5日更新于 2025年3月8日
在当前实现 `util.param_groups_lrd` 中,参数组被分配了一个 `lr_scale` 来支持层次式学习率衰减。然而, `lr_scale` 并不直接用于为每个参数组设置实际的学习率 (lr)。PyTorch 的优化器如 `AdamW` 会使用参数组中的 `lr` 关键字来确定学习率。由于当前代码仅分配了 `lr_scale` 而未将其应用于基本学习率,所有层实际上都使用相同的学习率,这破坏了层次式衰减的目的。
内容来源: facebookresearch/mae