overlong_penalty 应将工具响应令牌排除在长度计算之外(使用 action_mask/action_ranges)
作者: thevasudevgupta创建于 2026年5月26日更新于 2026年6月18日
在进行"代理"训练(即使用工具进行训练)时,过长缓冲使用了以下行中的"经验响应长度": https://GitHub.com/OpenRLHF/OpenRLHF/blob/6c6056daa522e2216466f6e0351cbe453434e185/openrlhf/trainer/ppo_utils/length_penalty.py#L45 响应长度包括来自工具响应的标记,如下行所示: https://GitHub.com/OpenRLHF/OpenRLHF/blob/3a9815c51aa7e985983eacd06504aaf6db0bbe6b/openrlhf/trainer/ppo_utils/samples_generator.py#L277 由于工具响应无法通过模型进行优化,这可能会给"代理"训练带来一些噪声,更糟糕的是,会阻止模型使用工具。 我们应该使用"action_mask"或"action_ranges"计算响应长度,在过长惩罚函数中。 我很乐意创建 PR 来修复此问题。 如果您需要,请让我知道。
内容来源: OpenRLHF/OpenRLHF