论文

具身智能体掌控一切:最小界面零射击智能体与视觉和语言导航领域的工业规模政策相竞争

Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation

智能体系统Agent 环境交互

摘要

自主实体必须维持一个漫长的决策循环,其中涉及感知、行动、验证和自我纠正等多个步骤。当前的系统通过特定于任务的工作流程或具体策略来维持这种循环。然而,这些固定的工作流程和策略在跨环境中提供的灵活性有限,并且在执行出错时通常缺乏有效的恢复策略。我们发现通用代理可以自行维持循环。我们将这种组织称为代理体现控制:推理模型直接引导每个动作,保持推理和控制一致。使用零镜头导航作为受控测试平台,我们为三个编码代理Harness配备了仅单目 RGB 相机和离散动作。在默认努力下,复制的 opus-5 平均成功率为 $70.7\pm3.5$%,而 fable-5 在最大努力下达到 78%。当训练有素的路径点工具与基元一起提供时,混合 fable-5 代理在默认工作量下达到 $76.7\pm0.6$%,使用一半的环境步骤和四分之一的墙壁时间。在所有消融中,模型选择主导着性能变化。观察到的Harness差异不大,强制航路点有助于较弱的模型,但可能会阻碍较强的模型。尽管更长的视野、延迟和上下文增长仍然是持续自治的障碍,但这些结果表明通用模型已经可以在没有导航策略的情况下实现竞争性的体现控制。