论文

LIBERO-Para:VLA 模型中释义稳健性的诊断基准和指标

LIBERO-Para: A Diagnostic Benchmark and Metrics for Paraphrase Robustness in VLA Models

智能体系统模型评测Agent任务评测鲁棒性、公平性与可信度评测

摘要

视觉-语言-动作 (VLA) 模型通过利用预先训练的视觉语言主干,在机器人操作方面实现了强大的性能。然而,在下游机器人设置中,它们通常使用有限的数据进行微调,导致对特定指令公式的过度拟合,并导致释义指令的鲁棒性未被充分探索。为了研究这一差距,我们引入了 LIBERO-Para,这是一个受控基准,可以独立改变动作表达和对象引用,以对语言泛化进行细粒度分析。在 7 个 VLA 配置 (0.6B-7.5B) 中,我们观察到释义下 22-52 pp 的性能持续下降。这种退化主要是由对象级词汇变化驱动的:即使是简单的同义词替换也会导致大幅下降,表明依赖于表面级匹配而不是语义基础。此外,80-96% 的失败源于计划级轨迹分歧,而不是执行错误,这表明释义会破坏任务识别。二元成功率对所有释义一视同仁,模糊了模型是否在不同难度级别上表现一致,还是依赖于更简单的情况。为了解决这个问题,我们提出了 PRIDE,这是一种使用语义和句法因素来量化释义难度的指标。我们的基准测试和相应的代码位于:https://github.com/cau-hai-lab/LIBERO-Para