论文
PROBE:使用 VLM 代理进行基于操作的视觉问答
PROBE: Manipulation-Grounded Visual Question Answering with VLM Agents
摘要
视觉语言模型 (VLM) 擅长静态场景中的 2D 基础、空间推理和基于代理工具的规划。然而,考虑询问家庭机器人“我的药物还在柜子里吗?”答案可能实际上隐藏在一排容器后面,必须首先将其移到一边。在现实世界的杂乱环境中回答此类问题需要在动态场景中进行推理:必须操纵干扰物以揭示被遮挡的对象,并且每个动作都会改变模型必须推理的场景。我们将此设置正式化为基于操作的视觉问答 (MG-VQA),并引入 PROBE,这是一个用于在此类任务上对 VLM 代理进行基准测试和微调的框架。我们首先开发了 PROBE-Sim,这是一款具有日常物体的高保真桌面模拟器,以及配备抓取和推动工具的机器人操纵器。 PROBE-Sim 用于创建 PROBE-Bench:一个评估套件,包含 150 个任务,涵盖杂乱的桌面场景中的 6 种问题类型,其中 VLM 在回答之前感知、拾起或推动物体。我们在所有前沿 VLM 中观察到一致的趋势:在所有任务类型中,基于代理工具的方法都优于仅感知的基线(平均 8.0%)。我们进一步设计了 PROBE-Agent,这是一种微调方法,可以使用混合数据方法将成功的轨迹从强大的教师基础模型提炼为较小的开放权重模型,从而鼓励操作高效的问答。 PROBE Agent 微调模型的性能优于现成的代理基线(平均 11.5%),并表现出对看不见的物体和保留任务的积极迁移。我们通过在现实桌面环境中部署 PROBE-Agent 微调策略来验证模拟到真实的传输。