论文
VLA Grounder:黑盒VLA模型的语言条件空间优化
VLA Grounder: Language-Conditioning Space Optimization for Black-Box VLA Models
摘要
视觉语言动作(VLA)模型常被当作以自然语言任务描述为条件的端到端动作策略。实践中其行为对指令措辞极为敏感——语言不只是任务标签,而是可优化的条件输入。我们研究能否通过优化语言空间而非更新动作权重来改进冻结的VLA策略。方法引入语言条件空间策略:把人类指令翻译为使用物体外观、空间关系与目标落地线索的简短VLA落地命令;该策略以失败派生的命令空间先验初始化,用稀疏任务完成奖励做强化学习优化,下游VLA完全冻结。在RL4VLA与VL-Think上的实验显示:语言条件空间优化在指令敏感、符号与多物体操作任务上提升成功率——语言可作为机器人基础模型的优化变量。
