论文
增强VLA的语言泛化:通过合成指令增广微调OpenVLA
Enhancing Linguistic Generalization of VLA: Fine-Tuning OpenVLA via Synthetic Instruction Augmentation
摘要
泛化仍是具身AI的核心挑战,因为机器人必须适应多样化的环境。尽管OpenVLA凭借大规模预训练代表了视觉-语言-动作(VLA)模型的最先进水平(SOTA),但在遇到全新环境时其零样本性能可能受限。本文提出一种参数高效微调策略,通过为Bridge Dataset V2合成通用指令集来增强OpenVLA的语言泛化能力。该论文利用大语言模型(LLM)为既有轨迹生成丰富多样的语义等价但结构各异的指令。在本实验中,采用低秩适应(LoRA)在增广后的配对数据上微调OpenVLA,使模型能够弥合复杂自然语言意图与机器人动作之间的鸿沟。结果证明了LoRA增强模型的鲁棒性,表明丰富专用数据集的语言空间对具身智能体至关重要。