批评者的输入是否仅限于即时输入?
作者: ginward创建于 2023年11月27日更新于 2023年11月27日
在 PPO 实现中,看起来评论模型将提示和生成的动作都视为输入(如果 pooled 为 true,则仅为生成的动作)。但是,如果我们将提示视为 S_t,而将提示与动作结合视为 S_t+T,那么值函数应该是 V(S_t) 而不是 V(S_t+T)?换句话说,在计算优势函数时,我们的值函数应该是提示的平均奖励。
内容来源: lucidrains/PaLM-rlhf-pytorch
在 PPO 实现中,看起来评论模型将提示和生成的动作都视为输入(如果 pooled 为 true,则仅为生成的动作)。但是,如果我们将提示视为 S_t,而将提示与动作结合视为 S_t+T,那么值函数应该是 V(S_t) 而不是 V(S_t+T)?换句话说,在计算优势函数时,我们的值函数应该是提示的平均奖励。
内容来源: lucidrains/PaLM-rlhf-pytorch