论文

G0.5:用于机器人推理和行动的一个自回归流

G0.5: One Autoregressive Stream for Robot Reasoning and Action

模型训练预训练

摘要

视觉-语言-动作 (VLA) 模型的流行配方将预训练的 VLM 与单独训练的流程匹配动作专家结合起来。这使得 VLM 成为上下文编码器而不是决策者。我们引入了 G0.5,一种预训练的自回归 VLA,其中单个 Transformer 解码器在单个目标下发出推理和动作标记。三个组件使其在基础模型规模上易于处理:可学习的跨实施例动作标记器,将异构机器人动作映射到共享词汇表中;一个本机思想链,将任务分解、对象基础和带有动作标记的动作提示交织在一起;以及通过视觉编码器注入多秒历史的视觉记忆模块。由于推理和动作共享一组权重,因此预训练的 VLM 的功能可以延续到物理行为:模型紧密遵循指令,并提示直接引导动作粒度、任务范围和分布外场景处理,而无需进一步训练。在大量机器人数据集和 VQA 样本上进行预训练,G0.5 超越了 7 个独立机制的最先进模型:R1lite 和 R1pro 机器人上的现实世界 微调($π_{0.5}$ 为 76.7\% vs.\ 53.3\%,GR00T-N1.7 为 24.4\%),2025 年使用通才策略对 50 个长视野家庭移动操作任务进行行为挑战($π_{0.5}$ 为 31.4\% vs.\ 26.3\%,挑战获胜者为 26.1\%),DROID 后训练 随后零样本传输到不可见的环境和物体 (82.5\%),一种遵循拾取和放置基准的语言, LIBERO (98.9\%)、RoboTwin 2.0 (93.3\%) 和 SimplerEnv-Bridge (87.3\%)。