论文
面向 MSTAR 自动目标识别的大型语言视觉问答模型
Towards a Large Language-Vision Question Answering Model for MSTAR Automatic Target Recognition
摘要
大型语言视觉模型 (LLVM),例如 OpenAI 的 ChatGPT 和 GPT-4,作为分析文本和图像的强大工具而受到关注。这些数据域的合并代表了重大的范式转变,对自动目标识别(ATR)具有深远的影响。最近基于 Transformer 的 LLVM 研究表明地理空间感知任务有显着改进。我们的研究探讨了 LLVM 在遥感图像字幕和视觉问答 (VQA) 中的应用,特别关注合成孔径雷达 (SAR) 图像。我们研究了新发布的 LLVM 方法,包括 CLIP 和 LLaVA 神经网络 Transformer 架构。我们已经开发了一个基于 MSTAR 公共数据集的正在进行中的 SAR 训练和评估基准。这已扩展到包括 VQA 任务的描述性文本标题和问答对。该挑战数据集旨在突破 LLVM 的界限,识别 SAR 图像中微妙的 ATR 细节。利用参数高效的 微调,我们训练了一种 LLVM 方法,以 98% 的准确度识别细粒度目标质量。我们详细介绍了我们的数据设置和实验,解决了可能导致误导性结论的潜在陷阱。在 SAR 数据中准确识别和区分军用车辆类型是一项严峻的挑战,特别是在复杂的环境条件下。掌握这种目标识别技能可能需要人类分析师数月的训练和数年的实践。这项研究代表了将 LLVM 应用于 SAR 应用的独特努力,推动了军事和情报领域的机器辅助遥感 ATR。