论文

Vesta:通用的具身推理模型

Vesta: A Generalist Embodied Reasoning Model

模型训练预训练

摘要

在开放世界环境中运行的机器人必须无缝集成定位、空间推理、导航和长期规划。虽然专业模型擅长执行单个任务,但部署多模型堆栈的计算成本很高,并且容易出现级联错误。我们推出 Vesta,一个统一的具身通用模型,它将这些功能整合到一个单一的基础模型中。我们的方法结合了旨在诱导空间定位的多样化和大规模的精选语料库和能够在较长时间范围内进行推理的简单多模态记忆工具。在不同的基准测试中,Vesta 平均比单个 SOTA 基线高出 >$20\%$,并且比每个类别最佳基线的整体高出 $>10\%$,从而证明通才模型可以匹配或超过专家模型。在现实世界中需要记忆和推理的机器人任务中,Vesta 将任务成功率提高了 >35%。因此,我们的工作表明,单一通才是一种可行的、可扩展的,并且可以说是比组合专家更好的替代方案。