论文

FabriVLA:具有保形动作块不确定性的轻量级视觉-语言-动作模型

FabriVLA: A Lightweight Vision-Language-Action Model with Conformal Action Chunk Uncertainty

模型优化小模型/轻量模型

摘要

视觉-语言-动作(VLA)模型已成为通用机器人操作的领先范例,但其计算成本和有限的不确定性意识阻碍了实际部署。我们提出了 FabriVLA,一种轻量级的 VLA,它融合了浅层和中间的 VLM 层以保留细粒度的视觉特征,并在动作标记之间控制自注意力,以便其流匹配头仅在训练允许的情况下才允许步间结构。经过单阶段端到端训练,FabriVLA 仅用 0.88B 参数就在 Meta-World MT50 上达到了最先进的 90.0% 平均成功率。我们进一步介绍了联合保形动作块校准(JCAC),这是一种 后训练 方法,它通过轻量级剩余尺度头增强了冻结策略。从单个策略查询中,JCAC 将学习到的元素误差范围转换为一个集合,该集合涵盖了用户选择的置信水平下的整个执行操作前缀,平均半径比无条件共形集小 3.3$\times$。在 LIBERO-Safety 上,这些边界在执行前按风险对执行轨迹进行排序,支持风险排名审查。 FabriVLA 和 JCAC 共同为具有校准动作不确定性的多任务操作提供了一个轻量级且可审计的框架。