论文

超越英语:揭示视觉-语言-行动模型中的多语言差距

Beyond English: Uncovering the Multilingual Gap in Vision-Language-Action Models

模型评测基准与评测资源

摘要

视觉-语言-动作模型最近展示了从大规模多模态数据中学习通用机器人策略的良好能力。然而,大多数现有的 VLA 系统主要使用英语指令进行训练和评估,而它们理解和执行其他语言指令的能力在很大程度上尚未得到开发。虽然底层的 大语言模型 通常具有多语言功能,但目前尚不清楚这些多语言功能是否在训练期间转移到 VLA。在这项工作中,我们首次对 VLA 模型中的多语言教学进行系统研究。我们首先通过翻译现有的基准来构建多语言指令。使用这些指令,我们在模拟设置中评估了一系列任务中的几个代表性 VLA 模型。我们的实验揭示了一个显着的多语言差距:主要根据英语指令训练的模型在其他语言上进行评估时表现出显着的性能下降,即使底层语言主干是多语言的。我们提供了一些调查结果和分析来了解多语言差距。跨语言迁移行为分析表明,性能下降与指令理解和动作执行相关。表征分析表明,多语言教学引起的表征变化可能会导致多语言差距。受这些发现的启发,我们进一步探索提高 VLA 多语言性能的策略。我们提出了一种简单而有效的多语言 微调 方法,即多语言主成分对齐,它利用主成分分析来获取主成分子空间并对齐投影的多语言表示,从而有效地缩小多语言性能差距。