论文

DAM-VLA:解耦异步多模态视觉语言动作模型

DAM-VLA: Decoupled Asynchronous Multimodal Vision Language Action model

模型架构新型架构

摘要

视觉语言动作(VLA)模型继承了视觉语言预训练的共享同步时钟,以一种速率处理每个输入。这与物理交互不一致,在物理交互中,高频模态以数百赫兹的速度变化,视觉发展更慢,而语言在整个情节中保持不变。同步 VLA 对慢模态进行过采样,对快速模态进行欠采样,并以最低有效频率限制动作生成。我们假设,将每个模态的时间处理解耦,让每个模态以自己的传感器速率更新和保留信息,会产生更强的表示和更鲁棒的控制。我们提出了 DAM-VLA,它保持按传感器速率刷新的每种模态潜在缓冲区,并由动作头连续读取,通过门控交叉注意力集成新的高频模态,使预训练的主干保持完整。在七个接触丰富的现实世界操纵任务中,DAM-VLA 使最强同步基线的平均成功率提高了一倍以上(95.2% vs. 40.95%),同时保持平滑、反应性 100Hz 控制。项目网站:\href{https://intuitive-robots.github.io/DAM-VLA/}{intuitive-robots.github.io/DAM-VLA/}