论文

HABILIS Brain 0:视觉-语言-动作和残余流量恢复的几何变化监督

HABILIS Brain 0: Geometry-Change Supervision for Vision-Language-Action and Residual Flow Recovery

模型训练监督微调与指令调优

摘要

视觉-语言-动作策略受益于几何监督,但当前框架几何本身并不能明确描述与操作相关的变化。这种设计的动机是学习一种与具体实施方式无关的视觉界面,该界面可以在机器人特定的动作对齐之前在机器人和以自我为中心的视频中进行预训练。我们引入了 Geometry-Change VLA (GC-VLA),它学习根据当前观察来预测多视图未来-当前几何变化标记。离线帧对定义标称 0.5 秒的预测范围;未来的观察结果仅用于构建训练目标。第一阶段训练几何变化视觉语言模型(GC-VLM)。第 2 阶段引入了连续的 ActionExpert 并将其与机器人动作对齐,同时在 VLM 接口处停止动作流梯度。第 3 阶段使这些梯度能够与 ActionExpert 联合更新可训练的 VLM 组件。第 4 阶段冻结 GC-VLA 并应用几何条件剩余流 (GCRF),使用二进制干预路由器和从闭环反馈中学习的单个有界剩余速度策略。 GC-VLA 在 LIBERO 上实现了 95.20% 的成功率,GC-VLA 与 GCRF 的成功率达到了 99.55%。推理使用当前观察结果和学习到的 GC 表示,而不执行离线目标编码器。