论文
VLAMotor:通过基于代理的数据合成来增强视觉-语言-动作模型的测试引导
VLAMotor: Test-Guided Enhancement of Vision-Language-Action Models via Agent-BasedData Synthesis
摘要
视觉-语言-动作(VLA)模型遵循数据驱动的范式,并受到训练数据覆盖范围的限制,这使得它们在部署后很容易在边缘情况配置上失败。为了减轻此类风险,必须公开高质量的故障模式并将由此产生的故障转换为监督数据以增强模型。现有的研究大多停留在故障检测上,缺乏利用发现的故障进行模型修复的机制。我们提出了 VLAMotor,这是第一个用于 VLA 增强的分析框架,它集成了用于故障暴露的距离感知模型测试和用于模型微调的基于代理的数据合成。首先,VLAMotor 根据与训练样本的距离估计输入不确定性,并将不确定性排序与冗余消除相结合,构建紧凑的测试集,以暴露各种故障。然后,VLAMotor 将故障轨迹抽象为结构化语义表示,并规划参数化的修复技能序列,然后通过逆运动学和运动执行将其实现为可执行轨迹。由此产生的成功轨迹会自动标记并用于微调原始 VLA 模型,从而生成增强的 VLA 模型。对四个代表性机器人操作任务的评估表明,VLAMotor 生成的模拟测试用例中有 92.33% 会触发 VLA 故障,并且 VLAMotor 将测试覆盖率比最先进的工具提高了 18.93%。通过微调 VLA模型以及从失败的测试用例中得出的合成数据,VLAMotor进一步将VLA模型的整体成功率提高了49.25%。当部署在真实硬件上时,仿真增强模型比原始VLA模型的成功率提高了57.50%,为VLA增强提供了有效且低成本的方向。