论文

通过联合生成和评估进行自我进化的深度研究

Self-Evolving Deep Research via Joint Generation and Evaluation

模型训练智能体系统奖励建模与过程监督智能体自我改进递归自我改进(RSI)

摘要

大语言模型 (LLM) 在日常应用中得到越来越多的采用,其中深度研究作为一项特别重要的能力脱颖而出。与传统的问答 (QA) 任务不同,深度研究报告的生成缺乏明确的 真值,使得奖励设计本质上无法验证,并限制了有效的强化学习。现有方法通过 LLM 作为法官和查询相关的评估规则来缓解这一挑战,但它们仍然依赖于静态评估器,这些评估器无法随着求解器的改进而调整其标准,从而导致优化压力不足并最终饱和。我们通过用于深度\textbf{re}搜索评估和生成(SCORE)的\textbf{s}自我进化\textbf{co}进化训练框架来解决这一限制,该框架在共享参数学习过程中将评估器和求解器紧密耦合。我们没有将生成和评估视为孤立的模块,而是利用它们的内在联系来实现单个共享参数模型中的联合改进。为了限制这个过程,我们引入了一个元工具,它根据求解器性能动态控制评估环境,鼓励有效的评估维度和足够深入的评估器搜索。对深度研究基准的广泛实验证明了报告生成质量的持续提高,表明共同进化的评估和生成是训练开放式研究代理的一个有前途的方向。