论文

LIRA:用于视觉-语言-动作解码的本地跨层信息路由

LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding

模型架构新型架构

摘要

视觉语言动作 (VLA) 模型将预训练视觉语言模型 (VLM) 的表示形式转换为机器人动作,但将中间 VLM 特征路由到动作解码器的接口仍未得到充分探索。现有设计要么仅暴露表示层次结构的一小部分,要么将每个解码器块严格匹配到一个 VLM 层,从而限制对跨深度的补充任务证据的访问。我们引入了 LIRA,这是一种本地跨层动作调节机制,它将 VLM 到动作调节制定为深度感知信息路由。 LIRA 对从中间 VLM 状态导出的任务词元特征和 LIRA 查询特征进行操作,然后为每个并行融合块分配一个以其对应的 VLM 层为中心的深度对齐的局部窗口。并行融合块聚合相邻的 LIRA 查询特征,并在动作预测之前将它们与任务词元特征和本体感受输入集成。该路由接口保持主干架构、动作解码器和监督训练方法不变。在 LIBERO、LIBERO-Plus、CALVIN ABC$\rightarrow$D 和实际操作中,LIRA 在相同的 0.5B 参数配置下改进了 VLA-Adapter 基线的主要聚合指标。在零样本转移到 LIBERO-Plus 的过程中,LIRA 将平均成功率从 59.1% 提高到 78.0%,提高了 18.9 个百分点,表明在受控分布变化下的鲁棒性得到了提高。