论文
HY-Embodied-0.5:现实世界代理的体现基础模型
HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents
摘要
我们推出 HY-Embodied-0.5,这是专门为现实世界的具体代理设计的一系列基础模型。为了弥合通用视觉语言模型 (VLM) 与实体智能体需求之间的差距,我们开发的模型旨在增强实体智能所需的核心功能:空间和时间视觉感知,以及用于预测、交互和规划的高级实体推理。 HY-Embodied-0.5 套件包括两个主要变体:专为边缘部署而设计的具有 2B 激活参数的高效模型,以及针对复杂推理而设计的具有 32B 激活参数的强大模型。为了支持具体任务所必需的细粒度视觉感知,我们采用 Mixture-of-Transformer (MoT) 架构来实现特定于模态的计算。通过合并潜在标记,这种设计有效地增强了模型的感知表示。为了提高推理能力,我们引入了迭代、自我进化的 后训练 范式。此外,我们采用 同策略 蒸馏 将大型模型的高级功能转移到较小的变体中,从而最大限度地发挥紧凑模型的性能潜力。对 22 个基准的广泛评估,涵盖视觉感知、空间推理和具体理解,证明了我们方法的有效性。我们的 MoT-2B 模型在 16 个基准测试中优于同等尺寸的最先进模型,而 32B 型号的性能可与 Gemini 3.0 Pro 等前沿模型相媲美。在下游机器人控制实验中,我们利用强大的 VLM 基础来训练有效的视觉-语言-动作 (VLA) 模型,在现实世界的物理评估中取得令人信服的结果。代码和模型开源于https://github.com/Tencent-Hunyuan/HY-Embodied。