论文
Libra-VLA:通过异步粗精双系统实现学习均衡
Libra-VLA: Achieving Learning Equilibrium via Asynchronous Coarse-to-Fine Dual-System
摘要
视觉-语言-动作(VLA)模型通过将高级语义指令转化为可执行的物理动作,成为通用机器人操作的一个有前途的范例。然而,流行的方法通常采用整体生成范例,以扁平、非分层的方式直接将视觉语言特征映射到高频运动命令。这种策略忽视了机器人操作的固有层次结构,复杂的动作可以在混合动作空间中自然地建模,分解为离散的宏观方向到达和连续的微观姿势对齐,严重扩大了语义驱动差距,并对将高级语义扎根于连续动作施加了沉重的表征负担。为了解决这个问题,我们引入了 Libra-VLA,一种新颖的从粗到细的双系统 VLA 架构。我们明确地将学习复杂性解耦为从粗到细的层次结构,以达到训练平衡,同时利用这种结构模块化来实现异步执行策略。语义规划器预测捕获宏观方向意图的离散动作标记,而动作细化器根据粗略意图生成高频连续动作以实现精确对齐。至关重要的是,我们的实证分析表明,性能遵循相对于动作分解粒度的倒 U 曲线,当学习难度在两个子系统之间达到平衡时达到峰值。通过异步设计,我们的方法为开放世界操作提供了可扩展、强大且响应灵敏的解决方案。