论文

LayerRoute:视觉-语言-动作策略的动作条件混合层路由

LayerRoute: Action-Conditioned Mixture-of-Layers Routing for Vision-Language-Action Policies

模型架构新型架构

摘要

视觉语言动作 (VLA) 策略利用预训练的视觉语言模型 (VLM) 来指导机器人控制的动作生成。 VLM 提供了分层的视觉语义表示,可以跨层发展,从局部视觉几何到抽象的、语言一致的语义;因此,不同的操作任务可能需要不同的层表示混合。同时,动作模块维护在整个动作计算过程中演变的中间表示,并可以为后续决策提供有用的信息。然而,现有的VLA接口在表示访问方面提供的灵活性有限:VLM信息通过每个动作层的固定层分配来公开,而中间动作状态仅通过剩余流隐式传播而没有显式重用。我们引入了 LayerRoute,一个动作条件表示路由接口,它支持对 VLM 层和动作表示的自适应访问。层混合路由器动态地形成缓存的 VLM 表示的混合,而操作状态重读则重用早期的操作表示。在不同的模拟和现实世界基准中,LayerRoute 持续改进了 StarVLA-$\pi$ 和 $\pi_{0.5}$,仅用 0.31% / 3.87% 的额外参数就在 LIBERO Long 上实现了高达 7.2 的增益。消融研究验证了动作条件层路由的好处,而路由分析揭示了跨动作层和任务设置的结构化分配模式。

LayerRoute:视觉-语言-动作策略的动作条件混合层路由:论文配图
图 1:原始标准 StarVLA-π\pi 与采用 LayerRoute 的 StarVLA-π\pi。原始接口使用固定的 VLM 上下文和仅残留操作状态访问,而 LayerRoute 支持操作条件分层路由和早期操作状态重用。