论文

UniEvo-VL:多模态模型自我改进的策略自蒸馏训练方法

UniEvo-VL: An On-policy Self-Distillation Training Recipe for Multimodal Model Self-improvement

摘要

现代多模态模型将生成和理解带入一个统一的系统中,这使它们能够提供自己的反馈并从中学习。受这种统一能力的推动,我们引入了 UniEvo-VL,这是一种多模态模型的自我进化框架,可以在测试时计算期间从这种建设性的自我纠正反馈中学习。我们不依赖单独的、通常规模更大的老师,而是利用他们的自我批评作为特权信息,并要求一个单一的多模态模型在不同的背景下同时充当老师和学生。学生只看到普通的问题,而老师则以特权批评为条件。然后,训练将学生自己的采样轨迹上的去噪扩散分布之间的每个状态的差异最小化。实验表明,UniEvo-VL 提高了多模态模型的图像生成能力,同时保持其对附加反思信息的敏感性。具体来说,我们在开源 Qwen-image-2512 的基础上构建,观察到 GenEval 上的性能显着提高,从 0.747 提高到 0.808,GenEval2 Soft-TIFA 上的性能显着提高,从 32.97 提高到 35.53。此外,与更强大的外部评审模型(例如GPT5.6-Luna)的尝试表明,具有强大判断能力的多模态模型可以预期更高的自我进化上限。最后但并非最不重要的一点是,文本渲染结果有好有坏表明,我们在不同任务中的自我改进可能并不统一。我们的研究旨在阐明当前热门的递归自我改进研究路线,以在没有外部监督或指导的情况下使用多模态模型时增强用户体验。