论文

通过连续软化回溯重采样稳定 MLLM 的无监督自我进化

Stabilizing Unsupervised Self-Evolution of MLLMs via Continuous Softened Retracing reSampling

模型训练强化学习

摘要

在多模态 大语言模型 的无监督自我进化中,后训练 期间反馈信号的质量对于稳定有效的学习至关重要。然而,现有的自进化方法主要依靠多数投票来选择最频繁的输出作为伪参考答案,这可能源于模型的内在偏差,而不是保证推理路径的客观正确性。为了抵消退化,我们在 MLLM 自进化中提出了连续软化回溯重采样(CSRS)。具体来说,我们引入了一种回溯再推理机制(RRM),即模型从锚点进行重新推理,以扩展对长尾推理路径的探索。同时,我们提出了软化频率奖励(SFR),它用连续信号代替二元奖励,根据采样推理集中答案的频率来校准奖励。此外,与视觉语义扰动 (VSP) 相结合,CSRS 确保模型优先考虑数学逻辑而不是视觉肤浅。实验结果表明,CSRS显着增强了Qwen2.5-VL-7B在MathVision等基准测试上的推理性能。我们在几何任务上的无监督自我进化中取得了最先进(SOTA)的结果。我们的代码可在 https://github.com/yyy195/CSRS 获取。