论文

语义-几何双重压缩:无需训练 视觉标记减少,用于超高分辨率遥感理解

Semantic-Geometric Dual Compression: Training-Free Visual Token Reduction for Ultra-High-Resolution Remote Sensing Understanding

摘要

多模态 大语言模型 (MLLM) 在地球观测中展现出巨大的潜力。然而,处理超高分辨率(UHR)图像时生成的大量视觉标记会带来高昂的计算开销,严重限制其推理效率。现有的视觉标记压缩方法主要采用静态和均匀的压缩策略,忽略了遥感解译任务中固有的“语义-几何二元性”。具体来说,对象语义任务专注于对象的抽象语义,并受益于积极的背景修剪,而场景几何任务则严重依赖于空间拓扑的完整性。为了应对这一挑战,我们提出了 DualComp,一种任务自适应双流词元压缩框架。 DualComp 在轻量级预训练路由器的动态引导下,将功能处理解耦为两个专用路径。在对象语义流中,空间连续语义聚合器(SCSA)利用大小自适应聚类来聚合冗余背景,同时保护小对象。在场景几何流中,指令引导结构恢复器(IGSR)引入了贪婪路径跟踪拓扑完成机制来重建空间骨架。在UHR遥感基准XLRS-Bench上的实验表明,DualComp以极低的计算成本完成了高保真遥感解译,实现了效率和精度的同步提升。