#1241·InternVL

在 MPO 后期训练后进行生成重复

作者: root221创建于 2025年12月16日更新于 2026年7月13日

感谢您发布了 InternVL 和与 MPO 相关的工作。 我已经在我们的模型中使用了 MPO。 数学推理基准测试,如 MathVista 和 MathVision,已经得到改进。 然而,在我们的实验中,模型开始出现重复。 我在论文中看到,在应用 DPO 时,这种行为是预期的。 我很好奇,在使用 MPO 时,是否也会出现类似的行为,以及如何缓解这种行为。

内容来源: OpenGVLab/InternVL