论文
行动前先改写:缓解视觉语言动作模型的措辞敏感性
Rephrase Before You Act: Characterizing and Mitigating Language Sensitivity in Vision-Language-Action Models
摘要
视觉—语言—动作模型(VLA)对指令措辞非常敏感,并未继承其视觉语言底座的语言鲁棒性。只改一个词,成功率就可能相差数十个百分点:对LIBERO炉灶,π₀.₅执行“switch on the stove”的成功率为100%,执行“switch on the hot plate”则为2%;即使经过改写增强微调的π₀,成功率波动仍可达61个百分点。我们用经过统计检验的单处编辑波动与理想措辞搜索刻画这种敏感性;后者表明,仅搜索措辞就几乎能弥合分布内外任务之间21个百分点的差距。随后,我们在不修改策略的条件下缓解问题。由于敏感性具有系统性,可以表达为明确规则:先为少数训练任务的多种措辞评分,再由大语言模型把证据提炼为10至20条改写规则,部署时按规则将每条新指令改写一次。在12个留出任务上,规则使冻结π₀面对对抗、VLM生成及人类生成措辞时的成功率相对提高16%至27%,收益主要来自分布外任务。在π₀.₅和LIBERO上也复现了这条管线,将微调任务范围内的成功率从93.6%提高到97.8%。方法无需重新训练或逐步验证,可零样本应用于未见任务和指令。项目网站:https://sttawm.github.io/rephrase-before-you-act
