论文

PhysBrain 1.0 技术报告

PhysBrain 1.0 Technical Report

模型训练合成数据

摘要

视觉-语言-动作模型发展迅速,但机器人轨迹本身为学习广泛的物理理解提供的覆盖范围有限。 PhysBrain 1.0 研究了一条补充路线:在机器人适应之前将大规模人类自我中心视频转换为结构化的物理常识监督。我们的数据引擎提取场景元素、空间动态、动作执行和深度感知关系,然后将它们转化为用于训练 PhysBrain VLM 的问答监督。由此产生的物理先验通过能力保留和语言敏感的适应设计进一步转移到 VLA 策略。在多模态 QA 基准测试和具体控制基准测试中,包括 ERQA、PhysBench、SimplerEnv-WidowX、LIBERO 和 RoboCasa,PhysBrain 1.0 实现了 SOTA 结果,并在 SimplerEnv 上显示出特别强大的域外性能。这些结果表明,从人类交互视频中扩展物理常识可以提供从多模态理解到机器人动作的有效桥梁。