使用 LLaMA-3.1-Nemotron-70B-Reward 作为 Puppeteer 状态编码器的理由
作者: Shengxiang-Lin创建于 2026年8月14日更新于 2026年8月19日
感谢您发布了这项有趣的工作的代码! 读完 Puppeteer 实现后,我的理解是,LLaMA-3.1-Nemotron-70B-Reward-HF 会被本地加载并使用 torch.no_grad() 冻结。在每个编排步骤中,其最后一个 token 的隐藏状态会被用作状态表示,并传递给 MLP 政策网络,而 REINFORCE 仅用于优化 MLP。 我注意到 README 允许用户替换奖励模型,但我无法找到对 70B Nemotron 奖励模型被选作默认状态编码器的解释。请您解释以下问题: 为什么选择 70B 奖励模型而不是更小的语言模型、奖励模型或嵌入模型作为主要动机? 奖励模型特定的表示是否对编排很重要,还是 Nemotron-70B 主要是作为一个强大的通用状态编码器? 您是否进行了使用更小模型(如 3B、7B 或 8B 编码器)的剔除实验?如果有,编码器大小对编排性能的敏感度如何? 了解这一设计选择对于评估编排能力是否主要来自于强化训练的 MLP 政策,还是主要依赖于 70B 模型的表示能力非常有帮助。 非常感谢您抽出时间!
内容来源: OpenBMB/ChatDev