论文
HELM:增强视觉语言动作模型长程操作的记忆、验证与恢复
HELM: Harness-Enhanced Long-horizon Memory for Vision-Language-Action Manipulation
摘要
尽管视觉-语言-动作(VLA)模型在短期操作任务上表现出色,但在长期操作任务上却系统性地失败。我们表明,在当前的反应式执行设置中,仅通过扩展上下文长度并不能解决此故障;相反,它源于三个重复出现的执行循环缺陷:记忆缺失、验证缺失和恢复缺失。我们提出了 HELM,这是一个与模型无关的框架,它通过三个组件解决了这些缺陷:通过 CLIP 索引关键帧检索关键任务历史记录的情景记忆模块 (EMM)、在执行之前根据观察、操作、子目标和记忆条件上下文预测操作失败的学习状态验证器 (SV),以及执行回滚和重新规划的Harness控制器 (HC)。 SV 是核心学习贡献:它始终优于基于规则的可行性检查和集成不确定性基线,并且其有效性主要取决于对情景记忆的访问。在 LIBERO-LONG 上,HELM 比 OpenVLA 提高了 23.1 个百分点的任务成功率(58.4% 到 81.5%),而将上下文窗口扩展到 H=32 只获得了 5.4 个百分点的增益,而相同预算的 LoRA 适配仍比 HELM 低 12.2 个百分点。 HELM 还提高了 CALVIN 的长期性能,并大大提高了受控扰动下的恢复成功率。消融和机制分析隔离了每个组件的贡献,并且我们发布了 LIBERO-Recovery 作为扰动注入协议,用于评估长视野操作中的故障恢复。