论文

SSL-R1:多模式自监督视觉强化 后训练 大语言模型

SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models

模型训练强化学习

摘要

具有可验证奖励(RLVR)的强化学习(RL)已经证明了增强多模态 大语言模型(MLLM)推理能力的巨大潜力。然而,对以语言为中心的先验和昂贵的手动注释的依赖阻碍了 MLLM 的内在视觉理解和可扩展的奖励设计。在这项工作中,我们介绍了 SSL-R1,这是一种通用的自监督 RL 框架,可以直接从图像中获取可验证的奖励。为此,我们重新审视视觉领域中的自监督学习(SSL),并将广泛使用的 SSL 任务重新表述为 RL 后训练 的一组可验证的视觉难题,既不需要人类也不需要外部模型监督。对 MLLM 进行这些任务的训练可显着提高其在多模式理解和推理基准上的性能,凸显了利用 MLLM 后训练 以视觉为中心的自我监督任务的潜力。我们认为这项工作将为设计有效的自我监督可验证奖励以大规模实现强化学习提供有用的经验。项目页面:https://github.com/Jiahao000/SSL-R1。