论文
LLaVA-LE:用于月球探索的大型语言和视觉助手
LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration
摘要
多模态视觉语言模型(VLM)的最新进展使得视觉和文本信息的联合推理成为可能,但它们在行星科学中的应用在很大程度上仍未得到探索。一个主要障碍是缺乏将真实行星图像与详细科学描述相结合的大规模数据集。在这项工作中,我们介绍了 LLaVA-LE(月球探索大型语言和视觉助手),这是一种专门用于月球表面和地下表征的视觉语言模型。为了实现这一功能,我们策划了一个新的大规模多模态月球数据集 LUCID(LUnar Caption Image Dataset),由 96k 高分辨率全色图像与描述月球地形特征的详细说明配对组成,以及从 LUCID 数据集中大约 20k 图像导出的 81k 问答(QA)对。利用该数据集,我们使用两阶段训练课程对 LLaVA 进行微调:(1)针对特定领域地形描述的概念对齐,以及(2)指令调整的视觉问答。我们进一步设计了跨越与月球地形分析相关的多个推理复杂性级别的评估基准。根据 GPT 和 Gemini 评委的评估,LLaVA-LE 的整体性能比 Base LLaVA 提高了 3.3 倍,比我们的第 1 阶段模型提高了 2.1 倍,推理得分为 1.070,超过了评委自己的参考分数,凸显了特定领域的多模态数据和指令调整在行星探索中推进 VLM 的有效性。代码可在 https://github.com/OSUPCVLab/LLaVA-LE 获取。