论文

ScienceBuddy:面向交互科研智能体的嵌套递归自我改进

ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents

智能体系统模型训练强化学习Agent Harness智能体自我改进Agentic RL递归自我改进(RSI)

摘要

我们介绍并发布交互科研工作空间ScienceBuddy,将持续改进的科研智能体带入研究者日常工作。它支持科学任务,并把研究者请求、反馈和执行证据转为持续学习所需的任务与评估准则。核心是递归中的递归自我改进范式,将Harness演化与模型强化学习耦合:内层在固定模型下改善Harness,外层在改进的Harness下训练模型。Harness演化塑造训练经验,模型学习又为Harness适配创造新机会。我们展示研究者交互、Harness优化和模型学习案例,基准案例覆盖四类科学任务。将ScienceBuddy作为研究产品发布,使科学界能够使用该范式,并迈向发现智能:科学AI通过与研究者持续协作进步,并伴随其支持的研究共同演化。网站见原摘要链接。