在使用非二元奖励时,降权经验也应考虑标准差。
作者: oaimli创建于 2026年7月24日更新于 2026年7月25日
目前的动态过滤策略基于奖励平均值,基本上会过滤掉过难或过易的样本。请参阅 trainer/ppo_utils/samples_generator.py 中的代码:
内容来源: OpenRLHF/OpenRLHF
目前的动态过滤策略基于奖励平均值,基本上会过滤掉过难或过易的样本。请参阅 trainer/ppo_utils/samples_generator.py 中的代码:
内容来源: OpenRLHF/OpenRLHF