论文

Pelican-Unify 1.0:用于理解、推理、想象力和行动的统一具身智能模型

Pelican-Unify 1.0: A Unified Embodied Intelligence Model for Understanding, Reasoning, Imagination and Action

模型架构混合架构

摘要

我们推出 Pelican-Unify 1.0,这是第一个根据统一原则训练的具体基础模型。 Pelican-Unify 1.0 使用单个 VLM 作为统一理解模块,将场景、指令、视觉上下文和动作历史映射到共享语义空间。同一 VLM 还充当统一推理模块,在一次前向传递中自回归产生任务、行动和面向未来的思想链,并将最终的隐藏状态投影到密集的潜在变量中。然后,统一未来生成器 (UFG) 以该潜在变量为条件,并通过同一去噪过程中的两个特定于模态的输出头联合生成未来视频和未来动作。语言、视频和动作损失都被反向传播到共享表示中,使模型能够在训练过程中共同优化理解、推理、想象力和动作,而不是训练三个孤立的专家系统。实验表明,统一并不意味着妥协。通过单个检查点,Pelican-Unify 1.0 在所有三个功能上都实现了强大的性能:八个 VLM 基准测试为 64.7,是同类规模模型中最好的; WorldArena 66.03,排名第一; RoboTwin 为 93.5,在比较的动作方法中排名第二。这些结果表明,统一范式成功地保留了专业力量,同时将理解、推理、想象力和行动纳入一个模型。