论文
想两遍,行动一次:面向具身智能体的验证器引导动作选择
Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents
摘要
构建能够解决复杂现实任务的通用具身智能体仍是AI领域的根本挑战。多模态大语言模型(MLLM)凭借强大的视觉-语言知识与思维链(CoT)推理显著提升了这类智能体的推理能力,但在面对具有挑战性的分布外场景时依然脆弱。为解决这一问题,我们提出验证器引导动作选择(Verifier-Guided Action Selection,VeGAS),一个通过显式验证步骤提升基于MLLM的具身智能体鲁棒性的测试时框架。在推理时,VeGAS不直接采用单一解码动作,而是采样一组候选动作,并使用生成式验证器挑选最可靠的选择,且不修改底层策略。关键的是,我们发现直接使用现成MLLM作为验证器并无提升,这促使我们提出LLM驱动的数据合成策略:自动构建多样化的失败案例课程,让验证器在训练时接触丰富的潜在错误分布。在覆盖Habitat与ALFRED环境的具身推理基准上,VeGAS持续提升泛化能力,在最具挑战性的多物体长时程任务上相对强CoT基线最高取得36%的相对性能增益。
