论文
RoboHarness:通过上下文适应实现视觉-语言-动作模型稳健性的记忆增强策略工具
RoboHarness: A Memory-Augmented Policy Harness for Vision-Language-Action Model Robustness via In-Context Adaptation
摘要
尽管视觉-语言-动作(VLA)模型有望成为通用机器人控制器,但它们在分布外(OOD)任务中对感知噪声和环境变化的鲁棒性仍然从根本上受到缺乏长期记忆、因果故障归因和动态干预能力的限制。为了解决这个问题,我们提出了 RoboHarness,这是一种内存增强策略工具,可以升级冻结的 VLA 策略,以实现强大的上下文适应,而无需参数 微调。具体来说,RoboHarness 通过对比双内存检索增强生成 (RAG) 的在线管道进行操作,这是一种使用多模态 大语言模型 实现的归因驱动的视觉语言编排器,以及可扩展模型上下文协议 (MCP) 干预,而离线内存合并模块不断将执行跟踪提炼为可靠的先验。在 LIBERO-PRO 和我们提出的 LIBERO-RoboHarness 基准上对三个骨干模型($π_0$、$π_{0.5}$ 和 SmolVLA)进行的实验评估表明,RoboHarness 的平均绝对成功率增益为 56.6%。这包括长期任务链的绝对显着提升 89.1%。项目页面和源代码可在 https://github.com/LZY-1021/RoboHarness 获取。