奖励科学过程:代理数据分析的过程级奖励建模
Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis
摘要
过程奖励模型 (PRM) 在增强 大语言模型 (LLM) 在数学等静态领域的推理能力方面取得了显着的成功。然而,它们在动态数据分析任务中的潜力仍未得到充分开发。在这项工作中,我们首先提出了一项实证研究,揭示了通用域 PRM 很难监督数据分析代理。具体来说,它们无法检测到无声错误、逻辑缺陷,这些错误会在不触发解释器异常的情况下产生不正确的结果,并且错误地惩罚探索性行为,将必要的试错探索误认为是基础失败。为了弥补这一差距,我们引入了 DataPRM,这是一种新颖的环境感知生成过程奖励模型,它(1)可以充当主动验证者,自主地与环境交互以探测中间执行状态并发现无声错误,(2)采用反射感知三元奖励策略来区分可纠正的基础错误和不可恢复的错误。我们设计了一个可扩展的管道,通过多样性驱动的轨迹生成和知识增强的步骤级注释,为 DataPRM 构建超过 8K 的高质量训练实例。实验结果表明,使用 Best-of-N 推理,DataPRM 在 ScienceAgentBench 上将下游策略 LLM 提高了 7.21%,在 DABStep 上提高了 11.28%。值得注意的是,仅使用 4B 参数,DataPRM 的性能就优于强大的基线,并且在不同的测试时间扩展策略中表现出强大的通用性。此外,将 DataPRM 集成到强化学习中比结果奖励基线产生了显着的收益,在 DABench 上实现了 78.73%,在 TableBench 上实现了 64.84%,验证了过程奖励监督的有效性。代码可在 https://github.com/zjunlp/DataMind 获取。