论文
通过频率专家的组合,利用多模态 大语言模型 进行一体化图像恢复
Leveraging Multimodal Large Language Models for All-in-One Image Restoration via a Mixture of Frequency Experts
摘要
多合一图像恢复旨在使用统一的框架从受各种和未知退化影响的输入中恢复干净的图像。最近的方法通过识别退化特征来指导恢复过程显示出强大的性能。然而,他们中的许多人将退化视为离散类别,这限制了他们对复合退化中出现的连续关系结构进行建模的能力。为了解决这个问题,我们提出了一种多模态 大语言模型 (MLLM) 引导的图像恢复框架,该框架利用多模态嵌入作为低级恢复的指导。具体来说,通过 MLLM 引导的融合块 (MGFB) 将 MLLM 派生的特征注入编码器-解码器架构中,以增强退化感知表示。此外,我们还采用了频率专家混合 (MoFE) 模块,该模块使用 MLLM 引导的上下文线索自适应地组合频率专家。为了进一步改进专家路由,我们设计了一个具有关系对齐损失的 MLLM 引导路由器,它鼓励与降级输入的嵌入空间关系一致的路由模式。对多个基准的大量实验表明,所提出的方法在不同的恢复设置中实现了强大的性能,并在具有挑战性的 CDD11 数据集上建立了新的技术水平,比以前的方法高出高达 1.35 dB。