论文
RISE:自我进化视觉语言模型的可靠改进
RISE: Reliable Improvement in Self-Evolving Vision-Language Models
摘要
视觉语言模型(VLM)已经实现了强大的多模态推理能力,但进一步提高它们仍然很大程度上依赖于对 后训练 的大规模人工构建监督。获得这种监督的成本很高,特别是对于推理密集型多模态任务来说,其中的问题、答案和反馈信号必须仔细设计。这激发了自我进化学习,模型通过双角色闭环来改进自身:提问者自主提出问题,解决者学习解决问题。然而,我们观察到当前的VLM自进化方法仍然面临三大挑战:粗粒度的角色交替延迟了问题生成和求解器适应之间的交互;生成的问题的质量可能会逐渐下降;问题类型可能会趋于狭窄的分布。这些问题限制了自我进化的效率和可靠性。因此,我们提出 \textbf{RISE},一个可靠的视觉语言模型自我进化框架。 RISE建立在三个互补的设计之上:细粒度的角色交替,缩短了提问者和解答者之间的反馈循环,以提高效率;质量监督员,提高问题的有效性和伪标签的可靠性;技能感知动态平衡,可减轻模式崩溃并在进化过程中保持广泛的技能覆盖范围。这些组件共同实现了未标记图像的更可靠、更有效的自我进化。在七个基准测试中的两个 VLM 主干上进行的实验表明,RISE 持续改进了基础模型,产生了广泛且持续的收益。我们的代码可在 https://github.com/AMAP-ML/RISE 上公开获取。