论文

行动前先改写:缓解视觉语言动作模型的措辞敏感性

Rephrase Before You Act: Characterizing and Mitigating Language Sensitivity in Vision-Language-Action Models

上下文与知识模型评测应用与实践上下文工程鲁棒性、公平性与可信度评测机器人

摘要

视觉—语言—动作模型(VLA)对指令措辞非常敏感,并未继承其视觉语言底座的语言鲁棒性。只改一个词,成功率就可能相差数十个百分点:对LIBERO炉灶,π₀.₅执行“switch on the stove”的成功率为100%,执行“switch on the hot plate”则为2%;即使经过改写增强微调的π₀,成功率波动仍可达61个百分点。我们用经过统计检验的单处编辑波动与理想措辞搜索刻画这种敏感性;后者表明,仅搜索措辞就几乎能弥合分布内外任务之间21个百分点的差距。随后,我们在不修改策略的条件下缓解问题。由于敏感性具有系统性,可以表达为明确规则:先为少数训练任务的多种措辞评分,再由大语言模型把证据提炼为10至20条改写规则,部署时按规则将每条新指令改写一次。在12个留出任务上,规则使冻结π₀面对对抗、VLM生成及人类生成措辞时的成功率相对提高16%至27%,收益主要来自分布外任务。在π₀.₅和LIBERO上也复现了这条管线,将微调任务范围内的成功率从93.6%提高到97.8%。方法无需重新训练或逐步验证,可零样本应用于未见任务和指令。项目网站:https://sttawm.github.io/rephrase-before-you-act

行动前先改写:缓解视觉语言动作模型的措辞敏感性:论文原图
图 1:方法概述。证据收集:VLM 重新表述每个训练任务,冻结的 VLA 在每个措辞上的成功部署形成了证据𝒟\mathcal{D}。规则蒸馏:LLM 将 𝒟\mathcal{D} 一次离线蒸馏为 10-20 个明确的措辞规则 RR。规则应用:在部署时,以 RR 为条件的 VLM 在将每个传入指令传递到未更改的 VLA 之前重写一次 (fRf_{R})。所示的措辞、分数和规则仅是说明性的。