#710·open-r1

SFT 软件 训练全程序列模型

作者: RohollahHS创建于 2025年11月10日更新于 2025年11月10日

在SFT期间,当前配置(recipes/OpenR1-Distill-7B/sft/config distill.yaml)会对整个输入序列(包括指令和用户即时)进行模型训练,而不是只注重推理+答案.

可以通过设置“-assistant only loss True”来纠正这种行为。 然而,问题在于现有的聊天模板无法妥善处理助手口罩,导致助理 masks成为了所有零. 因此,通过`-Assistant only loss True',加上以下修改的聊天模板,使模型在SFT期间只接受推理+答案培训。

2zz
CHAT TEMPLATE = "" (中文(简体) ).
——如果工具 ——
++- “ im  start ++ system\n ”
QQ- 如果消息 [0]['role'] === 系统===
QQ- 消息 [0]['内容']
还有...
XQ-'You are Open-R1,由Hugging Face训练来帮助用户的一种语言模型. 作为一名助理,你的作用是通过系统的思考过程彻底地探讨问题,然后提供最后的准确和准确的解决办法。 这就需要开展全面的分析、总结、探索、重新评估、反思、反向跟踪和反复循环,以发展深思熟虑的思维过程。 请将您的回复构建为两个主要部分: 使用指定格式的思考和解决方案: < Think> 思维部分 </想 > 解决部分. 在"思想"栏目中,按步骤细化你的推理过程. 每一步骤都应包括分析问题、总结相关结论、集思广益、核实目前步骤的准确性、改进任何错误并重新审视以前步骤等详细考虑。 在解决方案部分,基于各种尝试,探索,以及思想部分的思考,系统地提出了你们认为正确的最终解决方案. 解决方案部分应合乎逻辑、准确、简洁和详细,以便得出结论。 现在,试着通过上述准则解决下列问题。
- 结束
\\\- “\ n# Tools\\\\ n 您可以调用一个或多个函数来帮助用户查询 。\\\ n\\\ n 您在 <tools > /tools > XML 标签中得到了函数签名 :\\ n <tools > 。
用于工具中的工具
——"\\""\\".
* 工具 * * * 工具 * * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * * 工具 * 工具 * 工具 * 工具 * 工具 * * 工具 * 工具 * 工具 * 工具 * 工具 * 工具 * * * 工具 * 工具 * * * 工具 * * 工具 * 工具 * *
{\fn黑体\fs22\bord1\shad0\3aHBE\4aH00\fscx67\fscy66\2cHFFFFFF\3cH808080}最后的结束 {\fn黑体\fs22\bord1\shad0\3aHBE\4aH00\fscx67\fscy66\2cHFFFFFF\3cH808080}我...
XML 标记 :\\\ n </tools\\ n\\ n 对于每个函数调用, 返回带有 <tool  call \/tool  call > 内函数名称和参数的 json 对象 :\\\ n < tolle  call \ n" name: < 函数- name > ,\"参数" : < args-json-object \ n </tool  call im end  {n > > >
还有...
QQ- 如果消息 [0]['role'] === 系统===
+ QQ- 'im  start + system\\n' + 消息 [0]['内容'] + “ im end|>\\n” + QQ
还有...
Hugging Face为帮助用户而训练的语言模型。 作为一名助理,你的作用是通过系统思考过程彻底探讨问题,然后提供
. . . . . . .

内容来源: huggingface/open-r1