论文

GigaBrain-0.7:三系统架构扩展具身基础模型

GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture

模型训练预训练

摘要

视觉-语言-动作(VLA)模型已成为通才实体代理的主导范例,在结构化环境中展示了强大的复杂和长期任务完成能力。然而,当前的 VLA 系统是否可以受益于更有效的架构设计、扩展到更大、更异构的数据体系,并实现跨任务和实施例更广泛的泛化,仍然是一个悬而未决的问题。为此,我们提出了 GigaBrain-0.7,这是一种具体化的基础模型,在不同的机器人实施例中具有显着改进的泛化能力。具体来说,GigaBrain-0.7通过三系统架构统一了理解、预测和动作,将预训练扩展到超过37,000小时的异构体现数据,并引入了单阶段对齐训练,联合优化视觉语言理解和多体现动作生成。与之前的 GigaBrain-0 系列和之前最先进的模型(包括 $π_{0.5}$)相比,GigaBrain-0.7 在基础零样本能力、语言条件指令跟踪和 后训练 任务成功率方面取得了实质性改进。特别是,在我们内部的Maker H01平台和主流机器人实例上,GigaBrain-0.7在家庭和工业场景中都表现出了强大的任务适应性和完成能力。所有训练代码和预训练模型权重将被发布。