论文

P1-VL:在物理奥林匹克中连接视觉感知与科学推理

P1-VL: Bridging Visual Perception and Scientific Reasoning in Physics Olympiads

模型训练强化学习Agentic RL

摘要

从符号操作到科学级推理的转变是大语言模型(LLM)的关键前沿,物理则充当把抽象逻辑与物理现实绑定起来的关键测试锚点。物理要求模型保持与支配宇宙的定律的物理一致性,这一任务从根本上需要多模态感知来把抽象逻辑落于现实。在奥林匹克层面,图形往往是构成性的而非示意性的,包含文本中缺失的边界条件、空间对称性等关键约束。为弥合这一视觉-逻辑鸿沟,我们推出P1-VL,一个为高级科学推理打造的开源视觉-语言模型系列。我们的方法把课程强化学习(以渐进难度扩展稳定后训练)与Agentic增强(在推理时实现迭代自验证)相协调。在HiPhO——一个涵盖2024-2025年13场考试的严格基准——上评估,旗舰模型P1-VL-235B-A22B成为首个获得12枚金牌的开源视觉-语言模型(VLM),并取得开源模型中的最先进性能。我们的智能体增强系统取得全球总排名第2,仅次于Gemini-3-Pro。在物理之外,P1-VL展现出出色的科学推理能力与泛化性,在STEM基准上显著领先于其基座模型。通过开源P1-VL,我们为通用物理智能迈出奠基性一步,让视觉感知与抽象物理定律更好对齐,服务于机器科学发现。

P1-VL:在物理奥林匹克中连接视觉感知与科学推理
图4:物理数据的收集流程。