论文
UniMem:统一视觉-语言-动作模型的多模态记忆和控制
UniMem: Unifying Multimodal Memory and Control for Vision-Language-Action Models
摘要
虽然视觉-语言-动作(VLA)模型利用互联网规模的预训练和以任务为中心的微调来在长期任务上实现出色的性能,但它们经常难以处理需要记忆的非马尔可夫任务。现有的记忆方法通常涉及用于长期记忆管理的额外视觉语言模型(VLM),从而引入内存瓶颈和断裂的训练管道。对多个历史帧进行调节可以使 VLA 能够访问过去场景的更多描述性特征,但如果以任意固定间隔选择帧,则可能会降低性能。为了解决这些限制,我们提出了 UniMem,这是一种将高层多模态记忆和底层控制统一在一个主干下的框架。 UniMem 采用事件分类器进行内存更新,采用关键帧编码器进行密集空间内存,并采用关键帧缓存技术来最大限度地减少策略策略执行轨迹期间的开销。我们针对顺序和空间内存的五项模拟和四项硬件任务评估了 UniMem,证明我们的统一单模型系统在模拟方面优于固定间隔图像采样基线(93.4% vs. 68.2%),在硬件方面优于分层基线(80.0% vs. 43.5%),同时提供更快的推理和易于采用的简单训练管道。项目网站:https://losterberg3.github.io/unimem-vla/