论文

如果可以的话来找我:响应式 VLA 的实时反馈去噪

Catch Me If You Can: Real-Time Feedback Denoising for Responsive VLAs

智能体系统Agent 环境交互

摘要

视觉语言动作(VLA)模型通过将预训练视觉语言模型的语义知识与表达动作生成策略相结合,在机器人操作方面表现出了很强的泛化能力。基于扩散的动作生成器对于建模时间连贯的动作块特别有效,但这些块通常在推理后开环执行。这限制了执行过程中对象移动、接触变化或场景变化时的响应能力。我们提出了 VLA-Feedback,这是一种将低频扩散规划与高频视觉反馈相结合的两个时间尺度的架构。 VLA-Feedback 不是在执行前对动作块进行完全去噪,而是保留其最终去噪步骤作为轻量级反馈接口,允许每个动作在执行前使用最新的观察结果进行纠正。这种设计保留了扩散规划器的表达能力,同时能够进行实时动作校正,而无需重新运行完整的视觉语言扩散模型。 VLA-Feedback 在静态 LIBERO 任务上与 GR00T 相匹配,同时将动态模拟任务的平均成功率从 27.5% 提高到 85.0%。在真实的机器人任务中,它将平均成功率从 51% 提高到 73%。其他材料可以在我们的项目页面上找到:此 https URL。