#1084·MiniCPM-V

如何微调音频双人能力?

作者: edward15241创建于 2026年3月12日更新于 2026年6月3日

这项工作和演示非常令人印象深刻。

我有兴趣对模型进行微调,特别是为了改善语音双相交互(同时听和说话)和中断处理. 然而,必须避免可能削弱这些能力的灾难性遗忘。

我希望对培训设计作出一些澄清:

  1. 中断培训 这个模型的"酒吧"是怎么训练的? 其执行方式是否类似于莫希风格的流言互动,还是FLM-Audio风格的双相对话模式?

  2. 双相互动(在发言时倾听) 模特儿如何在说话时听话? 训练数据中是否包含重叠的语音部分,还是允许双相行为和独白生成的特殊互动格式?

  3. 关于一些细化细节 如果我们想要微调数据以保持双倍能力,如何输入数据来建模? (我想培训数据可能遵循类似于Hugging Face聊天模板的格式. 然而,我不知道 驳船事件 或中断标签是如何编码 在数据集)

谢谢

内容来源: OpenBMB/MiniCPM-V