RLHF 的初始模型。
作者: Jhangsy创建于 2023年8月1日更新于 2026年5月6日
标签documentationresearch-paper
Hi, LLaMA 2 页的论文中写道:"我们从 **预训练的聊天模型检查点**初始化我们的奖励模型,因为这可确保两个模型都能从预训练中获得的知识中受益。" 这里提到的 "**预训练的聊天模型检查点**" 指的是原始的预训练模型或经过 SFT 的模型。 我认为应该是经过 SFT 的模型。 有人能确认一下吗?
内容来源: meta-llama/llama