价值函数

作者: tonylin52创建于 2023年3月9日更新于 2025年1月17日

你好,我对 instructGPT 论文中的“价值函数”感到困惑。在论文中,它提到:“如前所述,对于所有 PPO 模型,我们使用 6B RM 和 6B 价值函数,后者是从前者初始化的。”**奖励模型(RM)和价值函数模型似乎是两个独立的模型。**然而,没有证据表明价值函数是 PPO RL 训练的参与部分,无论是在目标函数中还是在论文的其他部分。

内容来源: lucidrains/PaLM-rlhf-pytorch