论文
Dr. Zero:无需训练数据的自进化搜索代理
Dr. Zero: Self-Evolving Search Agents without Training Data
摘要
随着高质量数据变得越来越难以获得,无数据的自我进化已成为一种有前途的范式。这种方法允许大语言模型(LLM)自主生成和解决复杂问题,从而提高其推理能力。然而,由于问题多样性有限以及多步推理和工具使用所需的大量计算,多轮搜索代理在无数据自我进化中陷入困境。在这项工作中,我们引入了 Dr. Zero,这是一个框架,使搜索代理能够在没有任何训练数据的情况下有效地自我进化。特别是,我们设计了一个自进化反馈循环,其中提议者生成不同的问题来训练从同一基础模型初始化的求解器。随着求解器的发展,它会激励提议者产生越来越困难但可解决的任务,从而建立一个自动化课程来完善两个代理。为了提高训练效率,我们还引入了跳组相对策略优化(HRPO)。该方法对结构相似的问题进行聚类以构建组级基线,有效地最小化评估每个查询的个体难度和可解决性时的采样开销。因此,HRPO 显着降低了求解器训练的计算要求,而不会影响性能或稳定性。大量的实验结果表明,无数据的零博士可以匹配或超越完全监督的搜索代理,证明复杂的推理和搜索能力只能通过自我进化而出现。
