论文

PixDLM:用于无人机推理分割的双路径多模态语言模型

PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation

模型评测基准与评测资源

摘要

推理分割最近已从地面场景扩展到遥感图像,但无人机数据带来了明显的挑战,包括倾斜视点、超高分辨率和极端尺度变化。为了解决这些问题,我们正式定义了无人机推理分割任务,并将其语义需求组织为三个维度:空间、属性和场景级推理。基于这个公式,我们构建了 DRSeg,一个用于无人机推理分割的大规模基准,包含 10k 高分辨率航空图像,并在所有三种推理类型中搭配思想链 QA 监督。作为基准伴侣,我们引入了 PixDLM,这是一种简单而有效的像素级多模态语言模型,可作为此任务的统一基准。 DRSeg 的实验建立了强有力的基线结果,并突出了无人机推理分割的独特挑战,为未来的研究提供了坚实的基础。