论文

IRSTD-智能体:通过变焦引导交互学习进行Agentic红外小目标检测

IRSTD-Agent: Agentic Infrared Small Target Detection via Zoom-Guided Interaction Learning

应用与实践视觉感知与空间理解

摘要

红外小目标探测在海上监测和空中监视中发挥着重要作用。尽管多模态大语言模型 (MLLM) 为视觉理解提供了有希望的能力,但现有的基于MLLM的方法难以精确定位红外小目标。在本文中,我们提出了 IRSTD-智能体,这是一种通过动态视觉搜索进行红外小目标检测的Agentic框架。该框架使MLLM能够自适应地确定在何处以及以何种规模检查图像,并逐步收集细粒度的视觉证据以实现精确的目标定位。五种互补的视觉工具(PROPOSAL、ZOOM、DETECT、DROP 和 REFINE)支持对象候选发现、自适应观察、目标定位、假设拒绝和目标范围细化,共同实现对原始分辨率图像的协调搜索过程。为了教MLLM进行这种搜索,我们引入了 Zoom 引导的交互学习,它使用注释派生的交互轨迹来监督工具选择和相应的参数。通过在 WideIRSTD-Full 和 IRSTD-1k 数据集上进行大量实验,我们证明 IRSTD-智能体优于评估的视觉语言模型,并增强了MLLM在 IRSTD 任务中的精确定位能力。

IRSTD-智能体:通过变焦引导交互学习进行Agentic红外小目标检测的原论文方法或结果图
图 2:IRSTD-智能体概述。 策略通过视觉工具与红外图像交互,获取局部观测结果并在证据工作区中积累目标定位。注释派生的交互轨迹监督工具选择和参数。候选发现和外观引导的细化支持搜索和本地化过程。