论文
多模态 大语言模型 能否真正理解小物体?
Can Multimodal Large Language Models Truly Understand Small Objects?
摘要
多模态 大语言模型 (MLLM) 在图像和视频分析、数学和物理奥林匹克等各种理解任务中表现出了巨大的潜力。然而,对于小对象理解(SOU)任务来说,它们仍然是空白和未经探索的。为了填补这一空白,我们引入了 SOUBench,这是第一个用于探索现有 MLLM 的小物体理解能力的综合基准。具体来说,我们首先设计了一种有效的自动视觉问答生成策略,构建了一个新的 SOU-VQA 评估数据集,其中包含 18,204 个 VQA 对、六个相关子任务和三个主要场景(即驾驶、空中和水下)。然后,我们对 15 个最先进的 MLLM 进行了综合评估,揭示了它们在小物体理解方面的薄弱能力。此外,我们开发了 SOU-Train,一个包含 11,226 个 VQA 对的多模态训练数据集,以提高 MLLM 的 SOU 能力。通过监督最新MLLM的微调,我们证明SOU-Train可以有效增强最新MLLM理解小物体的能力。综合实验结果表明,所提出的 SOUBench 以及 SOU-VQA 和 SOU-Train 数据集为社区进一步开发具有增强小物体理解能力的模型提供了重要的经验基础。数据集和代码:https://github.com/Hanfj-X/SOU。