#1263·OpenRLHF

功能请求: 在 PPO/GRPO 训练期间监控奖励黑客行为的触发点

作者: Aarav500创建于 2026年7月10日更新于 2026年7月12日

功能请求

为 OpenRLHF 的 PPO/GRPO 训练器添加可选的监控钩子,这些钩子跟踪与奖励破坏开始相关的信号 - KL 与基准加速度、熵坍缩趋势和优势分布偏移 (Wasserstein 与滚动基准) - 与现有的训练指标一起记录。相关代码:https://GitHub.com/Aarav500/flight-recorder (Apache-2.0),其中已经实现了这些提取器用于 GRPO。

内容来源: OpenRLHF/OpenRLHF