论文
ICI-VLA:视觉-语言-动作模型的情境模仿与时空对齐演示
ICI-VLA: In-Context Imitation with Spatiotemporally Aligned Demonstrations for Vision-Language-Action Models
摘要
视觉-语言-操作 (VLA) 策略通常通过额外的梯度更新来适应新的操作设置,这在特定于任务的数据或计算稀缺时限制了快速部署。我们提出了 ICI-VLA,这是一种训练和检索框架,它通过上下文演示为文本动作 VLM 配备了少量测试时间适应功能。与基于特定动作多模态融合的主流 VLA 设计不同,ICI-VLA 保留了原生文本生成接口。 ICI-VLA仅在离线训练期间更新其参数;由此推断,该政策仍然是固定的,并且以检索到的微观示范为行动生成的条件。该框架将长轨迹分解为短的、语义标记的示例,并使用动态时间规整 (DTW) 挖掘的正值训练 RD 编码器,将检索到的上下文与当前子任务的阶段和几何结构对齐。我们进一步介绍了目标操作屏蔽,这是一种上下文损坏目标,旨在减少直接操作复制并增加对当前观察的依赖。 ICI-VLA 在 LIBERO 上的平均成功率达到 97.7%,在 RoboTwin 2.0 上达到 60.4%,比 RoboTwin 2.0 报告的最高基线平均成功率高出 19.3 个百分点。它在四项体力任务中也达到了 83.2%。这些结果表明,固定的 VLA 策略可以受益于测试时时空对齐演示的调节。