论文
TBD-VLA:时间块扩散视觉语言动作模型
TBD-VLA: Temporal Block Diffusion Vision Language Action Model
摘要
离散视觉-语言-动作 (VLA) 模型通常将动作生成公式化为离散动作空间上的下一个词元预测,并根据先验上下文自回归调节每个词元。虽然有效,但这种范式会导致较高的推理延迟,并且在很大程度上忽略了动作轨迹固有的时间结构。最近的努力引入了并行解码来提高效率,从而实现更快的推理,但缺乏用于建模词元依赖性的明确机制。我们引入了 TBD-VLA,这是一种基于离散词元的 VLA 框架,它结合了块扩散来实现时间动作生成。我们将动作序列划分为时间块,并在每个块内执行屏蔽离散扩散,同时保持跨块的自回归生成。该设计结合了时间自回归和并行动作解码,实现了强大的时间一致性和提高的推理速度。此外,显式时间建模可以通过时间修复异步执行动作块(例如实时分块)。 TBD-VLA 在模拟和现实操作任务中都显着优于先前的 VLA 方法,为快速、时间感知、离散 VLA 模型提供了一条可扩展的路径。项目网页:https://tbd-vla.github.io/