论文
PaperGym:以Rubric为中心的研究计划生成演进
PaperGym: Rubric-Centered Evolution for Research-Plan Generation
摘要
研究规划是AI科学家的决定性能力。然而,研究计划不承认可验证的答案,因此强化学习缺乏它所需的环境:与评价器配对的任务。从科学论文中提取的评价标准可以为评价器提供帮助。然而,现有的管道从相同的内容中提取问题和标准,因此可以通过释义来获得奖励。每次采样时,该评价准则都会进一步压缩为单个标量。我们推出 PaperGym,这是一个统一的框架,可将每篇研究论文变成一个完整的训练环境。 PaperGym 利用了论文的结构:问题是从研究目标和背景中综合出来的,而标准则是从方法和实验中得出的。该标准涵盖了方法创新和实验设计,标准泄漏率降至 3.7%,而现有数据集中为 11.90% 至 34.10%。训练使用该评价准则两次:首先作为 OPSD 自学教师的特权背景,然后作为 GRPO 的奖励。在 Qwen3-1.7B/4B/8B 中,该时间表的表现优于受监督的 微调(无论是单独阶段还是反向排序),将五个基准平均值提高了 +5.6、+5.0 和 +4.8 点。在配方固定的情况下,在 PaperGym-20k 上训练的模型在三向比较中赢得了 58.1%,而在 RubricHub Science 上赢得了 28.2%。经过训练的 Qwen3-8B 在 ResearchQA 上达到 73.48,高于更大的 Kimi K2.6。我们发布了管道、20,000 个实例的语料库 PaperGym-20k 以及基准 PaperGym-Innov 和 PaperGym-Design。