论文

扩展面向逐轮Agentic强化学习的科学发现环境

Scaling Scientific Discovery Environments for Turn-Level Agentic RL

模型训练强化学习Agentic RL

摘要

大规模语言模型代理在数据驱动的科学研究任务中展示了显著的能力,其中代理与执行环境交互并产生统计性声明。长期的科学研究分析受限于缺乏现实世界科学数据中的过程监督环境。本文介绍SciDisco,一种用于过程可验证环境中的科学研究代理训练的可扩展框架。SciThèque将假设、数据集、隐藏证据图和验证器编译成任务环境,在交互过程中检查分析进展。基于图的轨迹合成使用这些环境来构建过滤后的多轮演示。DiscoPO然后使用环境作为训练信号,为产生可验证的分析证据的行动分配回合级信用。实验表明,SciDisco-14B在基于假设的科学研究数据分析基准上达到了最先进的性能。

扩展面向逐轮Agentic强化学习的科学发现环境:论文配图
图1:SciDisco 流程:(1) SciThèque 从科学数据集构建可扩展的数据、假设、验证器环境集合;(2) 轨迹合成通过可执行分析原语遍历证据 DAG,将被接受的状态转移保留为多轮 SFT 示范;(3) DiscoPO 以经验证的 DAG 进展增量定义逐轮奖励,将贡献分配给产生证据的轮次。