论文

Robust-U1:MLLM 能否自我恢复损坏的视觉内容以实现稳健理解?

Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding?

模型训练强化学习

摘要

多模态 大语言模型 (MLLM) 在视觉理解方面取得了显着的成功,但在现实世界的视觉损坏下,它们的性能显着下降。虽然现有的鲁棒性增强方法存在,但它们是有限的:黑盒特征对齐缺乏可解释性,并且白盒基于文本的推理无法恢复丢失的像素级细节。这项工作调查了一个基本研究问题:MLLM 能否自行恢复损坏的视觉内容?为了解决这个问题,我们提出了 Robust-U1,这是一种新颖的框架,为 MLLM 配备了明确的视觉自我恢复能力,以实现稳健的理解。该方法包括三个核心阶段:用于初始重建的监督 微调、用于对齐高视觉质量的双重奖励(像素级 SSIM 和语义级 CLIP 相似性)的强化学习,以及共同考虑损坏的输入和恢复图像的多模态推理。大量实验表明,Robust-U1 在现实世界腐败基准上实现了最先进的鲁棒性,并在通用 VQA 基准上的对抗性腐败下保持了卓越的性能。分析证实,高质量的视觉恢复可直接增强推理能力,将自我恢复确立为稳健视觉理解的关键机制。源代码可在 https://github.com/jqtangust/Robust-U1 获取。