论文
FATE-VLA:视觉-语言-动作模型的故障感知测试生成
FATE-VLA:Failue-aware test generation for vision-language-action models
摘要
视觉-语言-动作(VLA)模型越来越多地用作通用机器人策略,但它们的评估仍然在很大程度上依赖于随机采样任务场景的静态基准。在高维体现空间中,故障是稀疏且聚集的,因此静态基准测试可能会低估鲁棒性风险。我们将 VLA 评估重新定义为一个主动的故障发现问题,并提出了一种故障感知测试生成方法,该方法将多样性驱动的探索与从观察到的执行中学习到的代理模型结合起来。该方法将测试引导到高风险但多样化的场景区域。在四个最先进的 VLA 模型中,它发现了更多的故障(比选定的基线高达 +29.7%),同时揭示了更多样的故障模式。这意味着,以GR00T-N1.6为例,成功率从64.4%下降到34.7%。更广泛地说,我们的研究结果呼吁 VLA 评估的转变:从固定任务套件的被动测量转向自适应、故障查找测试生成,在部署之前暴露模型弱点的结构。