论文
InternVLA-A1.5:统一理解、潜在预见和组合概括的行动
InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization
摘要
机器人操纵的统一模型旨在为一种策略配备预先训练的 VLM 的语义先验和通过未来预测学习到的物理动力学。在实践中,现有的设计往往会侵蚀预训练主干的语义,受到异构目标之间的干扰,并在像素空间中从头开始学习未来的预测,从而使预训练视频生成器的动态先验未被利用。我们提出了 InternVLA-A1.5,它在本机 VLM 主干上构建策略,持续进行 VQA 和子任务预测训练,并附加一个轻量级统一专家用于连续动作生成。未来预测被重新定义为一个潜在查询问题,其中一小组可学习的预见词元在冻结的预训练视频生成模型的监督下将与任务相关的未来压缩为紧凑的潜在代码,因此该策略继承了世界模型动态先验,而无需学习像素级生成。视频分支在推理时被丢弃,保持实时控制。 InternVLA-A1.5 在 120 万个机器人场景和 3M 多模态样本上进行预训练,在所有六个模拟基准上均取得了最佳总体结果。在现实世界中,保留的语义在保留的指令绑定上提供了最强的组合概括,并且两种设计共同维持了长期执行。