论文

训练代理,而不是专家:学习利用异构专家进行多轮视觉推理

Train the Agent, Not the Expert: Learning to Harness Heterogeneous Experts for Multi-Turn Visual Reasoning

智能体系统Agent 工具调用

摘要

计算机视觉的最新进展已经产生了一系列强大的专用模型,用于检测、分割、计数和其他视觉任务。然而,这些模型通常针对孤立的任务公式进行优化,因此很难直接支持通用视觉智能,特别是当任务需要复杂的语言理解和密集的小物体感知时。在本文中,我们提出了 VisHarness,一种可训练的视觉代理,它将高级感知、推理和决策与低级任务执行分离。 VisHarness 不是训练模型来解决特定的视觉任务,而是学习利用一组精心设计的异构视觉专家。这种范式保留了代理的一般智能,同时充分利用了具体视觉任务中专用视觉模型的精度优势。只需轻量级训练,VisHarness 就可以学习通用的视觉专家利用策略,并可以通过与视觉专家模型的多轮交互来解决各种复杂条件下的常见基本视觉任务。为了在实时环境中实现高效的 同策略 强化学习训练,我们引入了动态视觉记忆归档,这可以减轻由于与视觉专家模型的多轮交互而导致的快速累积的视觉词元开销。在推理分割、广义引用分割、密集小目标检测和引用计数等四个代表性基准上进行的实验表明,VisHarness 的性能大大优于现有的通用模型,并且与特定任务模型相比,实现了具有竞争力或优越的性能。