论文

用于协作重建的多轮多智能体对话提高了 VLM 在空间推理上的性能,但也只是勉强提高

Multi-Turn Multi-Agent Dialogue for Collaborative Reconstruction Improves VLM Performance on Spatial Reasoning, But Only Barely

模型评测模型能力评测

摘要

在不同环境中运行的机器人依靠视觉输入来解释物体和空间布局。在人类协作任务中,他们需要通过语言传达这种理解。视觉语言模型(VLM)支持涉及视觉解释、问题回答和指令遵循的机器人任务,但它们在需要空间推理的协作对话任务中的能力仍未得到充分开发。我们通过协作结构构建任务来研究这一差距,该任务结合了视觉解释、基础、语言引导的交互和动作生成。我们开发了一个框架,其中 VLM 使用对话根据视觉和文本输入重建目标结构。我们跨交互设置、输入模式和图像表示评估开放权重和封闭式 VLM。结果表明,对于评估的 VLM 来说,视觉表示的空间推理仍然很困难。目标的详细文本表示在跨模态条件下产生更高的重建成功率,而分解的图像表示提高了性能。这些发现揭示了协作 VLM 代理的视觉空间基础和基础指令生成的局限性。