论文

QuantumQA:借助物理一致数据集与验证感知强化学习提升科学推理

QuantumQA: Enhancing Scientific Reasoning via Physics-Consistent Dataset and Verification-Aware Reinforcement Learning

模型训练强化学习奖励建模与过程监督RLVR

摘要

大语言模型(LLM)在通用推理上能力突出,但在量子力学这类要求严格遵守物理约束的科学领域通常缺乏可靠性。这一局限源于可验证训练资源的稀缺,以及标准对齐范式中粗粒度反馈信号的不足。为应对数据挑战,我们提出 QuantumQA,一个通过任务自适应策略与混合验证协议构建的大规模数据集,该协议将确定性求解器与语义审计相结合以保证科学严谨性。在此基础上,我们提出为可验证奖励强化学习(RLVR)定制的验证感知奖励模型(VRM),其采用自适应奖励融合(ARF)机制,动态地将来自科学执行套件(SES)的确定性信号与多维语义评估整合,以实现精确监督。实验结果表明,我们的方法持续超越基线与通用偏好模型。值得注意的是,我们优化后的 8B 模型取得与专有模型相当的性能,验证了将可验证的基于规则的反馈纳入强化学习循环,可作为纯规模扩展之外的参数高效替代方案。

QuantumQA:借助物理一致数据集与验证感知强化学习提升科学推理:论文配图
图1:QuantumQA数据集构建与验证流水线,展示物理一致量子题目的生成、核验及其支撑验证感知强化学习的路径。