奖励模型的损失函数。

作者: huzechuan创建于 2023年1月31日更新于 2023年2月12日

你好, 我有点疑惑, ChatGPT 的奖励模型的损失函数的输入是两个响应的差值,然后通过了 sigmoid 函数。然而, 这个仓库中的损失函数只接受一个响应作为输入, 并使用排名分数作为标签来计算 CE 损失。这样做是否有优势呢?

内容来源: lucidrains/PaLM-rlhf-pytorch