论文

AdaHVLA:用于长期视觉-语言-行动执行的自适应Harness

AdaHVLA: Adaptive Harnesses for Long-Horizon Vision-Language-Action Execution

智能体系统Agent Harness

摘要

视觉-语言-动作 (VLA) 模型提供强大的本地控制和指令遵循,但常常难以处理需要持久记忆和规划的长期任务。任务工具通过保留任务历史记录并跟踪执行阶段的进度,为代理推理提供持久的上下文。为了将这些互补功能结合在一起,我们引入了 AdaHVLA,这是一种自适应工具,可通过机器人经验完善基于代码的协调策略,以更好地将代理推理和记忆与 VLA 执行相结合。其解耦的多主体适应过程将证据分析、利用修订和行为评估分离到不同的工作环境中,使用可测试的协调假设来指导修订和后续执行轨迹,以评估其预测效果。有状态的修订图将执行证据、假设、修订和观察到的效果联系起来,保留替代方案和适应记忆,以指导重复尝试的细化以及跨任务和环境的持续适应。在模拟中,AdaHVLA 将 NaVILA-LH 的平均测试成功率从 22.5% 提高到高达 57.5%,并将三个 VLA 主干的操作测试成功率比初始工具提高了 30.8 个百分点。现实世界的部署进一步说明了调整后的策略如何支持跨任务阶段的稳定执行。