论文
LIBERO-Agent:评估直接具体操作的通用Agent
LIBERO-Agent: Evaluating General-Purpose Agents for Direct Embodied Manipulation
摘要
通用Agent可以计划、使用工具并根据反馈修改其行为,但目前尚不清楚这些能力是否从数字环境转移到具体操作。为了研究这个问题,我们引入了 LIBERO-Agent,这是一个用于在机器人操作任务中评估这些Agent的原生代理基准。 LIBERO-Agent 不是要求Agent提交任务级 Python 控制程序或通过高级机器人技能进行操作,而是提供了一个交互式机器人环境,Agent可以在其中选择要检查的观察结果,使用自己的工具处理它们,并发出本机操作命令。 LIBERO-Agent 将 200 个任务集成到一个通用交互框架中,并提供了一个包含 30 个任务的主套件,将感知、短视野执行和长视野组合分开。结果揭示了明显的可靠性差距:虽然Agent在感知和简单的短期任务上表现良好,但他们在困难的短期和长期任务上的表现却大幅下降。更丰富的观察可以改善短期操作,而演示的好处取决于Agent和格式。在这些药物中,GPT-6 Astra 取得了最强的整体性能。进一步分析表明,其主要优势在于机构相互作用,特别是当需要持续的物理接触时,而其剩余的故障则源于跨级干扰和几何误差。