论文
在任何场景中进行检测:具有体验感知推理的对象检测代理框架
Detect in Any Scene: An Agentic Framework for Object Detection with Experience-Aware Reasoning
摘要
由于不同的图像质量和异构的对象分布,现实场景中的对象检测仍然具有挑战性,这极大地阻碍了现有检测器的泛化。传统方法,包括特定于场景的表示学习和端到端管道设计,本质上因其对预定义条件的依赖而受到限制,并且缺乏对动态环境的适应性。在本文中,我们提出了 DetAS,一种代理检测框架,它将对象检测制定为动态决策过程。 DetAS 不依赖静态管道,而是利用多模态 大语言模型 (MLLM) 作为中央代理,通过从恢复模块和专用检测器的工具箱中进行选择来自适应地组成检测工作流程。具体来说,DetAS 由两个关键组件组成:自适应图像恢复,动态确定是否以及如何增强下游检测的图像;多专业检测,集成多个领域专用检测器并通过实例级推理解决其预测。为了进一步提高细粒度条件下的决策质量,我们引入了自进化经验收获并将框架扩展到DetAS-X,它从一小组带注释的数据中积累节点级决策经验,并在推理过程中实现经验感知推理。这种机制允许系统逐步完善其决策策略并适应不同的现实场景。对六个具有挑战性的基准进行的大量实验表明,DetAS-X 的性能显着优于现有的基于 MLLM 的检测器,F1 分数平均提高了 28.36%,在 DarkFace 上的增益高达 37.01%。这些结果证明了代理检测的前景,并为其在复杂和动态环境中的应用奠定了坚实的基础。