论文

科大讯飞具身Omni技术报告

iFLYTEK-Embodied-Omni Technical Report

模型架构混合架构

摘要

通用具身智能体必须理解多模态指令、预判环境如何演化——并在长时域上产生精确控制动作。既有方法通常专注于视觉语言推理、基于视频的世界建模或动作生成——而先合成未来观测再推断动作的级联管线可能引入接口瓶颈并复合预测误差。我们呈现iFLYTEK-Embodied-Omni——统一多模态基础模型——在单一Omni框架内联合建模视觉(视频与图像)、语言与动作。其模态专属的视觉语言、视频生成与动作生成组件经共享多模态自注意力通信。该设计确立脑-小脑协作:视觉语言模型与视频生成模型构成高级脑——负责指令理解、任务规划、进度追踪与未来视觉状态预测;动作生成模型充当底层小脑模块——把规划的子目标与共享多模态上下文直接转换为可执行动作块。为发展这些能力——我们组合来自人类示范与机器人交互的带动作与无动作具身视频——连同具身推理、具身感知与通用图文数据——构建综合数据集。我们进一步采用四阶段策略——渐进训练VLM、VGM与AGM——再联合微调完整模型。

科大讯飞具身Omni技术报告:论文配图
图 1:科大讯飞-Embodied-Omni 概述。 (A) 统一的 Omni 架构通过特定于模态的块和共享的多模态自注意力来协调语言、视觉(图像和视频)和动作表示。 VLM 和 VGM 形成高层“大脑”,而 AGM 则充当产生行动的低层“小脑”。 (B) 多源训练数据包括动作标记轨迹、无动作视频、空间推理数据以及问答和任务规划数据。 (C) 四阶段管道逐步训练 VLM、VGM 和 AGM,然后对完整模型进行联合微调。