#364·ART

特点:支持 GRPO 博士

作者: giladfrid009创建于 2025年8月25日更新于 2026年9月4日
标签enhancement

如果艺术能够支持 Dr. GRPO 优化器就太好了。基本上,Dr. GRPO 旨在消除原始 GRPO 中存在的响应长度偏差,同时保留 GRPO 的性能优势。有关更多信息,请参阅 Dr. GRPO 论文重要注意: trl 的 GRPOTrainer 已经通过在 GRPOConfig 中设置 loss_type="dr_grpo" 来支持此技术。我认为这种技术可能会有所帮助,特别是对于多回合 RL 场景,其中 token 长度的增长更为显著。