论文

PhysBrain 1.5:从视觉语言模型到物理基础模型

PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models

模型架构新型架构

摘要

我们推出了 PhysBrain 1.5,这是一个用于理解物理环境、生成动作和预测未来状态的统一模型。在观察、互动和环境变化的物理循环的推动下,我们将这些能力纳入一个共同的学习框架中。从通用视觉语言模型开始,我们将语言响应、末端执行器运动和密集视觉目标编码为离散序列,并通过自回归下一个标记预测联合优化它们。预训练完全从人类交互视频中提取具体监督,使用以任务为中心的片段将语义和空间上下文与恢复的运动和后续观察配对。然后,我们通过对人类演示、机器人轨迹和模拟体验的混合进行监督微调来调整模型。在 28 个具体理解基准测试中,我们的 8B 模型平均得分为 72.5,创下了新的开源技术水平,其性能与 GPT-6-Astra 和 Gemini 3.6 Flash 等领先的专有模型相当。它在 14 项基准测试中取得了最佳开源结果,同时保留了一般的多模式功能。除了这些理解评估之外,定性示例还表明该模型能够生成末端执行器轨迹,并通过空间对齐的 RGB、深度和机器人掩模输出来预测未来场景。