论文

Mat-Pref:可验证奖励训练改善无机材料的成分推理

Mat-Pref: Verifiable-Reward Training Improves Compositional Reasoning in Inorganic Materials

模型评测基准与评测资源

摘要

可验证奖励的强化学习(RLVR)推动了数学和代码推理的快速进步,但当扩展到科学时,现有的基准并不能分解概括的内容:收益反映结构转移、属性转移还是记忆?我们引入了 Mat-Pref,它是跨 11 个无机结构族的 10,837 个离子取代问题的基准,基于材料项目的密度泛函理论计算,具有隔离分布性能、泛化到完全保留的结构族和跨属性转移的三个评估分割:将带隙推理应用于仅通过形成能量监督在训练期间看到的主体。四个零样本前沿模型(70-671B 参数)每次分割都保持在 33-54% 的范围内,证实仅靠规模并不能解决该任务所需的成分化学推理。受监督的 微调 的两阶段管道以及随后的组相对策略优化 (GRPO) 将 Qwen3-8B 的分布率提升至 65.2%,在保留系列上提升至 71.6%,在两个结构泛化分裂上均超过零样本 Qwen3-235B 超过 20 个百分点。自一致性抽样表明,SFT 策略已经可以产生正确的答案,但无法可靠地将其呈现为模态响应; GRPO 重塑了分布,使正确答案成为模态答案,而不仅仅是可达性,并且这种更清晰的承诺在机制上是可见的:logits 透镜分析揭示了关键决策层答案结晶的 ${\sim}$20pp 优势。我们将这一观察结果形式化为干扰排列一致性指标,在该指标下,GRPO 将宽松评分(至少一个排列正确)和严格评分(所有排列正确)之间的差距从 24.0 个百分点缩小到 14.3 个百分点。