论文
扩展面向逐轮Agentic强化学习的科学发现环境
Scaling Scientific Discovery Environments for Turn-Level Agentic RL
摘要
大规模语言模型代理在数据驱动的科学研究任务中展示了显著的能力,其中代理与执行环境交互并产生统计性声明。长期的科学研究分析受限于缺乏现实世界科学数据中的过程监督环境。本文介绍SciDisco,一种用于过程可验证环境中的科学研究代理训练的可扩展框架。SciThèque将假设、数据集、隐藏证据图和验证器编译成任务环境,在交互过程中检查分析进展。基于图的轨迹合成使用这些环境来构建过滤后的多轮演示。DiscoPO然后使用环境作为训练信号,为产生可验证的分析证据的行动分配回合级信用。实验表明,SciDisco-14B在基于假设的科学研究数据分析基准上达到了最先进的性能。
