#1270·OpenRLHF

在使用非二元奖励时,降权经验也应考虑标准差。

作者: oaimli创建于 2026年7月24日更新于 2026年7月25日

目前的动态过滤策略基于奖励平均值,基本上会过滤掉过难或过易的样本。请参阅 trainer/ppo_utils/samples_generator.py 中的代码:

内容来源: OpenRLHF/OpenRLHF