论文
面向数学对象的推理:同策略奖励建模与测试时聚合
Reasoning over mathematical objects: on-policy reward modeling and test time aggregation
摘要
精确推导数学对象的能力是数学、物理、化学等下游STEM应用的核心要求,在这些场景中推理必须最终落实为形式化结构的表达式。然而,由于自动化评估的便利性,当前对LM数学与科学推理的评估严重依赖数值或选择题等简化的答案格式。本文为改进面向数学对象的推理提供三项贡献:(i)构建并发布用于推导数学对象的训练数据和基准,即Principia套件;(ii)提供使用强LLM评审(LLM-judge)与验证器的训练配方,并证明同策略(on-policy)评审训练能提升性能;(iii)展示如何利用同策略训练通过聚合来扩展测试时算力。我们发现Qwen3-235B和o3等强模型在Principia上表现挣扎,而我们的训练配方能在不同LLM骨干上带来显著提升,同时改进现有数值题和MCQA任务的成绩,证明了推理能力的跨格式泛化。
