论文
深入场景:通过焦点计划生成打破视觉语言决策中的感知瓶颈
Dive into the Scene: Breaking the Perceptual Bottleneck in Vision-Language Decision Making via Focus Plan Generation
摘要
在机器人操作和导航等具体视觉语言决策任务中,视觉语言和视觉语言动作模型(VLM 和 VLA)是强大的工具,具有不同的优势:VLM 更擅长长期规划,而 VLA 更擅长反应控制。然而,它们的性能受到相同的感知瓶颈的限制:由于模型无法区分与任务相关的物体和干扰物,因此出现了幻视。原则上,准确识别并聚焦关键对象,同时过滤掉不相关的对象是打破这一限制的关键。一种简单的解决方案是一步集中:直接关注重要的对象。然而,这种方法被证明是无效的,因为有效的聚焦本质上需要深入的场景理解。为此,我们提出了SceneDiver,这是一种利用VLM长期规划能力的从粗到细的焦点计划生成方法,它首先构建一个整体场景图来建立初步理解,然后通过识别、理解和分析的迭代循环逐步将任务分解为更简单的子问题。为了实现反应控制,我们还设计了一个轻量级适配器,用于将刻意聚焦能力提取到 VLA 中。对标准嵌入式 AI 基准的评估证实,我们的方法大大减少了 VLM 和 VLA 的视觉幻觉,同时保持了需要快速执行的任务的计算效率。我们的代码和数据发布于:https://future-item.github.io/SceneDiver。