论文
一种具有语言提示的一体化多模态遥感图像恢复与融合的统一基础模型
A Unified Foundation Model for All-in-One Multi-Modal Remote Sensing Image Restoration and Fusion with Language Prompting
摘要
遥感图像受到云、雾霾、噪声、分辨率限制和传感器异质性的影响。现有的恢复和融合方法针对每种退化类型训练单独的模型。在这项工作中,我们提出了语言条件的大规模遥感恢复模型(LLaRS),这是第一个多模态和多任务遥感低层视觉的统一基础模型。 LLaRS 采用 Sinkhorn-Knopp 最优传输将异构频带对齐到语义匹配的槽中,通过三个互补的专家混合层(用于空间模式的卷积专家、用于频谱保真度的通道混合专家以及用于全局上下文的低秩适配器的注意力专家)路由特征,并通过步级动态权重调整稳定联合训练。为了训练 LLaRS,我们构建了 LLaRS1M,这是一个百万规模的多任务数据集,涵盖 11 个恢复和增强任务,将真实的配对观察和受控合成退化与不同的自然语言提示相结合。实验表明,LLaRS 始终优于七个竞争模型,参数高效的微调实验证明了对未见数据的强大传输能力和适应效率。仓库:https://github.com/yc-cui/LLaRS