论文

OmniFysics-Nano-V2 技术报告:跨模态理解物理世界

OmniFysics-Nano-V2 Technical Report: Understanding the Physical World Across Modalities

模型训练强化学习RLVR

摘要

全模态模型已把多模态交互扩展到视觉、音频、语音与语言。然而,其训练主要围绕语义描述与通用目标组织,物理属性、交互状态与因果机制只被部分刻画。这一差距并非单纯的模态覆盖问题:增加更多模态本身并不能提供把观察与世界物理结构连接起来所需的监督。我们提出 OmniFysics-Nano-V2,一个面向物理世界感知与理解的紧凑全模态模型。该模型在共享推理框架内支持图像、视频、音频、语音与文本输入,并支持文本与语音生成。为弥补显式物理监督的缺失,我们构建双分支的物理感知数据管线:把显著对象锚定于结构化物理属性,并把视觉变化与声学事件、中间响应及交互结果对齐。为克服同质化训练目标,我们按奖励多样性整理强化学习提示,并采用两阶段 GRPO 课程,从通用任务正确性推进到细粒度物理感知推理。在多模态、视听与物理推理基准上的实验表明,所提出的数据与训练策略在保持广泛全模态能力的同时提升了物理世界理解。该模型在 21 个基准中的 17 个上取得领先于 SOTA 全模态模型的结果。通过赋予 AI 系统全模态与物理世界感知的双重能力,OmniFysics-Nano-V2 有望成为下一代物理 AI 的基石。

OmniFysics-Nano-V2 技术报告:跨模态理解物理世界:论文配图
图 1:通用多模态模型与所提出的 OmniFysics-Nano-V2 的示意图。与通用数据集和训练策略不同,我们设计了具备物理感知能力的数据流水线,同时纳入静态属性数据与动态事件数据;此外,我们采用多阶段强化学习来提升模型的物理感知能力。