论文

具身智能体的环境理解视觉语言模型

Environmental Understanding Vision-Language Model for Embodied Agent

智能体系统Agent 环境交互

摘要

视觉语言模型(VLM)对于遵循指令的实体代理表现出强大的感知和推理能力。然而,尽管有这些能力和泛化性能,它们仍然面临环境理解方面的限制,经常无法交互或在执行过程中依赖于环境元数据。为了应对这一挑战,我们提出了一个名为环境理解实体代理(EUEA)的新颖框架,它微调了四种核心技能:1)用于识别相关对象的对象感知,2)用于生成交互子目标的任务规划,3)用于判断成功可能性的动作理解,以及4)用于确定目标完成情况的目标识别。通过具有 EUEA 技能的 微调 VLM,我们的框架可以实现更可靠的指令跟踪任务执行。我们进一步引入了一个利用这些核心技能的恢复步骤和一个改进不一致技能预测的组相对策略优化(GRPO)阶段。恢复步骤对替代操作进行采样以纠正故障情况,GRPO 阶段完善不一致的技能预测。在 ALFRED 任务中,我们的 VLM 显着优于行为克隆基线,平均成功率提高了 8.86%。恢复和 GRPO 阶段提供额外 3.03% 的增益,进一步增强整体性能。最后,我们的技能水平分析揭示了闭源和开源 VLM 环境理解的关键局限性,并确定了有效代理与环境交互所需的功能。