论文
CLEAR:释放统一多模态模型中退化图像理解的生成潜力
CLEAR: Unlocking Generative Potential for Degraded Image Understanding in Unified Multimodal Models
摘要
模糊、噪声、压缩和照明不良导致的图像质量下降严重破坏了现实环境中的多模态理解。将理解和生成结合在单一架构中的统一多模态模型自然适合这一挑战,因为它们的生成路径可以对退化破坏的细粒度视觉结构进行建模。然而,这些模型未能利用自身对退化投入的生成能力。我们将这种脱节追溯到两个复合因素:现有的训练机制从不要求模型在推理过程中调用生成,并且标准的解码-重新编码路径不支持有效的联合优化。我们提出了 CLEAR,一个通过三个渐进步骤连接这两种功能的框架:(1)在退化感知数据集上监督 微调,以建立生成然后回答的推理模式; (2) 潜在表示桥,用生成和推理之间的直接、可优化的连接取代解码-重新编码的迂回; (3)Interleaved GRPO,一种在答案正确性奖励下联合优化文本推理和视觉生成的强化学习方法。我们构建了 MMD-Bench,涵盖六个标准多模式基准的三个退化严重程度级别。实验表明,CLEAR 显着提高了降级输入的鲁棒性,同时保持了清晰图像的性能。我们的分析进一步表明,消除像素级重建监督会导致具有更高感知质量的中间视觉状态,这表明任务驱动的优化和视觉质量自然是一致的。