FineVLA:可操纵视觉-语言-动作策略的细粒度指令对齐
FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies
摘要
人们越来越期望视觉-语言-动作(VLA)模型不仅能完成机器人任务,还能遵循人类关于如何执行这些任务的指令。然而,现有的机器人数据集通常将轨迹与粗略的目标级语言配对,而未指定执行关键的细节,例如主动臂、接近方向和接触区域。这限制了可引导的策略学习和机器人视频理解。我们推出 FineVLA,这是一个针对行动的细粒度 VLA 监督的开放框架。该框架包括:(1)一个数据构建工具,它统一了来自 10 个开源机器人数据集的 85K 任务中的 972,247 条轨迹,并构建了 FineVLA-Data,这是一个由 47,159 条细粒度轨迹组成的经人工验证的数据集; (2) 一个包含 500 个视频、11,631 个原子事实和 1,030 个 VQA 问题的测试基准; (3) 机器人专用的 VLM 注释器,用于可扩展的细粒度注释; (4) 可操纵的 VLA 策略,通过细粒度和原始目标级指令的受控混合物进行训练。我们的实验产生了三个发现。首先,细粒度的监督不会牺牲目标级别的成功:在所有设置中,仅 FG 比仅原始提高了 +1.4 到 +8.1 的成功率点。其次,细粒度指令和原始指令是互补的,遵循一致的倒 U 趋势,在 FG:Raw = 1:2 到 1:1 处达到峰值。最佳混合设置在 RoboTwin 模拟中达到 86.8%/82.5%,在现实世界双臂操作中达到 62.7/100(相对于仅 Raw 的 49.9)。第三,细粒度的监督改善了可操纵控制:现实世界中最大的增益出现在姿势(+23)、颜色(+18)和接近方向(+18)上——目标级指令不提供指导的因素。总体而言,细粒度的语言应该增强目标级指令:指定如何执行以及要实现的目标。项目页面:https://finevla.xlang.ai/