论文

视觉-语言-动作模型中稳健指令泛化的基础语义重新绑定

Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models

模型架构新型架构

摘要

视觉-语言-动作(VLA)模型在机器人操作方面表现出色,但在简单解释规范指令时会出现灾难性的性能下降。尽管这种脆弱性通常可以通过昂贵的数据扩展来解决,但我们的探索表明,根本原因是架构而不是缺乏语义理解。具体来说,我们证明当前的 VLA 成功地在内部保留了正确的任务标识。失败实际上源于动态视觉观察和文本的联合编码,这引入了系统的特征变化。由于下游操作策略很容易受到这些变化的影响,因此它无法将保留的语义转换为正确的控制命令。为了解决这个结构瓶颈,我们提出了扎根语义重新绑定(GSR),这是一种优雅的干预措施,通过将独立提取的任务语义与本机视觉特征显式融合,从头开始训练完全重新初始化的动作专家,从而绕过不稳定的联合路由。这种有针对性的干预仅使用规范演示即可显着恢复释义不变性。在 LIBERO-Para 基准测试中,GSR 将成功率提高了高达 44.6%。它使轻量级模型能够与大规模基线相媲美,并将最先进的模型推向新纪录的 PRIDE 分数 70.4,在指令生成能力方面优于最近推出的大规模预训练模型小米-Robotics-0。基于这些见解,我们还引入了 ParaVLA,这是一种本机解耦的 0.33B 参数模型,对指令重写表现出近乎完美的鲁棒性。最终,我们的工作证明,可以通过优雅的结构设计来实现强大的语义基础,绕过低效的强力数据扩展范式。