论文

物理-R1:经过审计的奥林匹克语料库并发布了视觉物理推理验证器

Physics-R1: An Audited Olympiad Corpus and Released Verifiers for Visual Physics Reasoning

模型训练奖励建模与过程监督

摘要

多模态物理推理的可跟踪改进依赖于本身很少经过验证的训练和评估系统:模型训练的语料库、优化的奖励以及评分的基准和评判。我们对这个系统进行端到端的审核,发现标准的构建实践系统性地扭曲了衡量标准:污染超过了n元重复数据删除,翻译降低了问题的质量,饱和的多项选择格式夸大了能力,部分学分的训练奖励更容易利用而不是获得,开放式评分默默地取决于法官的选择。如果未经验证,这些扭曲会夸大报告的进展并将测试知识泄漏到训练中。我们用发布的验证器系统来回答:三阶段污染审计,验证经过审计的多模式训练语料库和保留的奥林匹克基准背后的训练/测试边界;提供强化学习训练奖励的二元答案验证器;以及一个答案判断工具,将每个开放式分数括在确定性严格层和大语言模型自由层之间。所有每条记录的判决都会发布,并与独立的开放重量裁判进行交叉核对,他的替换会改变绝对分数,但保留每个基地到训练的举重的标志。针对二进制答案验证器的训练证实了经过认证的语料库支持训练:参考配方将 8B 开源基础在三个种子的保留基准上提升了 18.3 分。简单的二元奖励还在四个开放式基准测试中的三个上击败了密集的部分信用变体,与第四个持平。所有验证者、判决和数据集都是公开的。