论文
科大讯飞具身Omni技术报告
iFLYTEK-Embodied-Omni Technical Report
摘要
通用具身智能体必须理解多模态指令、预判环境如何演化——并在长时域上产生精确控制动作。既有方法通常专注于视觉语言推理、基于视频的世界建模或动作生成——而先合成未来观测再推断动作的级联管线可能引入接口瓶颈并复合预测误差。我们呈现iFLYTEK-Embodied-Omni——统一多模态基础模型——在单一Omni框架内联合建模视觉(视频与图像)、语言与动作。其模态专属的视觉语言、视频生成与动作生成组件经共享多模态自注意力通信。该设计确立脑-小脑协作:视觉语言模型与视频生成模型构成高级脑——负责指令理解、任务规划、进度追踪与未来视觉状态预测;动作生成模型充当底层小脑模块——把规划的子目标与共享多模态上下文直接转换为可执行动作块。为发展这些能力——我们组合来自人类示范与机器人交互的带动作与无动作具身视频——连同具身推理、具身感知与通用图文数据——构建综合数据集。我们进一步采用四阶段策略——渐进训练VLM、VGM与AGM——再联合微调完整模型。
