论文
DUALVISION:用于稳健视觉推理的 RGB 红外多模态 大语言模型
DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning
摘要
多模态 大语言模型 (MLLM) 在使用 RGB 图像的视觉感知和推理任务中取得了令人印象深刻的性能,但它们在雾、模糊或低光条件等常见退化情况下仍然脆弱。红外 (IR) 成像是 RGB 的完善补充,在这些条件下提供固有的鲁棒性,但其与 MLLM 的集成仍有待探索。为了弥补这一差距,我们提出了 DUALVISION,这是一种轻量级融合模块,可通过补丁级局部交叉注意力有效地将 IR-RGB 信息合并到 MLLM 中。为了支持训练和评估并促进未来的研究,我们还引入了 DV-204K(包含约 25K 个公开对齐的 IR-RGB 图像对和 204K 模态特定 QA 注释的数据集)和 DV-500(包含 500 个 IR-RGB 图像对和 500 个 QA 对的基准,旨在评估跨模态推理)。利用这些数据集,我们对开源和闭源 MLLM 进行基准测试,并证明 DUALVISION 在各种视觉退化情况下都能提供强大的经验性能。我们的代码和数据集可在 https://abrarmajeedi.github.io/dualvision 获取。