论文

RxBrain:具备联合语言—视觉推理与想象的具身认知基础模型

RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination

模型架构混合架构

摘要

具身认知要求智能体把高层任务推理与要达成的物理状态连接起来。我们介绍Hy-Embodied-RxBrain:具备联合语言—视觉推理与想象能力的具身认知基础模型。与强调场景理解与文本决策的视觉语言模型、或主要预测未来视觉状态的生成式世界模型不同,RxBrain把具身计划表示在单一规划序列中——语言与视觉想象扮演互补角色:语言提供计划的抽象结构(任务分解、规划原语、约束、时序与决策逻辑),视觉想象经世界状态预测与联合子目标规划落地该结构——把每个规划步骤与中间及最终物理状态关联。RxBrain采用统一的多模态混合Transformer架构:在单一模型内支持语言、图像与视频的理解与生成。为训练该能力,我们构建自动化管线:把具身视频分解为规划步骤并与视觉状态转移对齐,转为联合文本—视觉规划监督。我们进一步引入RxBrain-Bench评估模型能否经联合文本与视觉组件表示具身计划。实验显示RxBrain保持具身理解与生成能力,并产出文本推理、世界状态预测与联合子目标规划耦合的计划。我们还把RxBrain扩展到连续机器人动作生成——在无大规模动作数据预训练下展现有前景的真机表现。这些结果迈出具身认知基础模型的第一步。

RxBrain:具备联合语言—视觉推理与想象的具身认知基础模型:论文配图
图 1:RxBrain 的功能概述。 RxBrain 支持统一模型内的多种具体任务,包括具体视觉问答、多帧视觉生成以及与视觉目标想象的联合文本推理。给定人类指令和视觉观察,该模型可以推理当前场景,想象未来或目标状态,并逐步生成联合语言和视觉规划。