论文
SCI-PRM:面向科学推理验证的工具感知过程奖励模型
SCI-PRM: A Tool Aware Process Reward Model for Scientific Reasoning Verification
摘要
虽然过程奖励模型 (PRM) 在数学推理方面取得了显着的成功,但它们在生物学、化学和物理学等复杂科学领域的应用在很大程度上仍未得到探索。科学问题不仅需要逻辑上的严谨性,还需要事实的一致性以及特定领域工具的精确使用,而在这些领域,当前的模型经常遭受幻觉和缺乏验证。在本文中,我们首先构建了 SCIPRM70K,这是一个具有工具链轨迹的大型数据集,它明确地将推理与科学工具的执行交织在一起。在此基础上,我们训练了一种名为 Sci-PRM 的高效奖励模型,为推理中每一步的工具选择、执行准确性和结果解释提供细粒度的监督。实验表明,Sci-PRM 在两个关键方面显着增强了基础模型:(1)它通过 Best-of-N 选择实现有效的测试时间扩展; (2)当集成到强化学习中时,它可以作为密集的奖励信号,缓解优势消失的关键问题,使模型突破现有的性能上限。
