#563·cleanrl

可选的监控回调,用于奖励破坏/训练不稳定信号

作者: Aarav500创建于 2026年7月10日更新于 2026年7月12日

CleanRL 的算法目前记录了标准的训练指标(损失、熵、KL),但没有标记 *奖励黑客* 或运行期间的不稳定性。我想提出一个 **可选的独立** `cleanrl_utils/monitors.py` — 默认情况下不被任何现有算法文件导入 — 用户可以通过在自己的脚本中添加几行代码来选择使用。它会跟踪 KL 与冻结参考的加速度、熵坍缩趋势和优势分布的偏移(Wasserstein 与滚动基准),并标记出现的事件。这来自于我构建的两个奖励黑客检测基准(RHOB、Flight Recorder) — 如果有用的上下文,我很乐意分享结果和方法。考虑到 CleanRL 的单文件哲学,我想先确认您是否希望在仓库中添加此内容(即使只是作为 `docs/` 或 `benchmark/` 下的示例),然后再花时间提交 PR。

内容来源: vwxyzjn/cleanrl