论文
StreamPI:视觉-语言-动作模型的流式多模态时态建模
StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models
摘要
视觉-语言-动作 (VLA) 模型已证明在机器人操作方面的有效性,但最先进的模型(例如 pi0.5)在单帧范式下运行,限制了它们保留过去观察结果和发展精确空间感知的能力。在本文中,我们提出了 StreamPI,一种流式多模态时间建模框架,为单帧 VLA 配备时间推理能力,而无需引入任何额外参数。一项核心设计是指令锚定时间建模。它将每个(视觉观察、语言指令)对视为一个原子时间单元:每对内的双向注意力能够实现跨模式融合,而跨对的因果注意力则保留自回归流推理。这确保了语言指令在整个任务执行过程中充当持久的语义锚。为了弥补同步训练和异步真实机器人部署之间的差距,我们引入了 andom-interval 流式训练策略:适当的帧间间隔(例如,每 3 帧)可以实现更快、更平滑的动作执行。除此之外,随机化间隔进一步提高了对帧定时扰动的鲁棒性,支持实践中的异步部署。此外,通过利用 LLM 主干的长度外推能力,StreamPI 无缝继承预训练的单帧权重,并支持灵活的单帧和多帧推理。对跨越依赖于内存和精确感知场景的真实机器人任务以及模拟基准 LIBERO 的实验表明,StreamPI 在各种任务中的表现均优于 pi0.5。