论文

VLA Grounder:黑盒VLA模型的语言条件空间优化

VLA Grounder: Language-Conditioning Space Optimization for Black-Box VLA Models

模型训练强化学习

摘要

视觉语言动作(VLA)模型常被当作以自然语言任务描述为条件的端到端动作策略。实践中其行为对指令措辞极为敏感——语言不只是任务标签,而是可优化的条件输入。我们研究能否通过优化语言空间而非更新动作权重来改进冻结的VLA策略。方法引入语言条件空间策略:把人类指令翻译为使用物体外观、空间关系与目标落地线索的简短VLA落地命令;该策略以失败派生的命令空间先验初始化,用稀疏任务完成奖励做强化学习优化,下游VLA完全冻结。在RL4VLA与VL-Think上的实验显示:语言条件空间优化在指令敏感、符号与多物体操作任务上提升成功率——语言可作为机器人基础模型的优化变量。

VLA Grounder:黑盒VLA模型的语言条件空间优化:论文配图
图 1:语言调节空间优化的视觉概述。故障导出的命令空间先验条件预先训练的 VLM 将用户指令和场景图像转换为简短的基于 VLA 的命令。此命令以 VLA 策略为条件,在不更新 VLA 权重的情况下提高操作成功率。