论文

EVE:通过可执行的视觉转换实现可验证的 MLLM 自我进化

EVE: Verifiable Self-Evolution of MLLMs via Executable Visual Transformations

模型训练强化学习

摘要

多模态 大语言模型 (MLLM) 的自我进化仍然是一个严峻的挑战:随着模型预测的漂移,基于伪标签的方法会遭受质量逐渐下降的困扰,而基于模板的方法仅限于一组静态的转换,无法适应难度或多样性。我们认为,稳健、持续的自我改进不仅需要独立于模型内部确定性的确定性外部反馈,还需要一种使训练分布永久多样化的机制。为此,我们引入了 EVE(基于可执行视觉转换的自我进化),这是一种新颖的框架,它通过利用不断丰富多样性和复杂性的可执行视觉转换来完全绕过伪标签。 EVE采用Challenger-Solver双策略架构。 Challenger 维护并逐步扩展视觉转换代码示例队列,从中合成新颖的 Python 脚本来执行动态视觉转换。执行这些脚本会产生带有绝对的、经过执行验证的 真值 答案的 VQA 问题,从而消除对模型生成的监督的任何依赖。集成语义多样性和动态难度校准的多维奖励系统引导挑战者丰富其代码示例队列,同时提出逐渐更具挑战性的任务,防止模式崩溃并促进两种策略之间的相互共同进化。大量实验表明,EVE 始终超越现有的自进化方法,为可验证的 MLLM 自进化建立了稳健且可扩展的范式。该代码可在 https://github.com/0001Henry/EVE 获取。