论文
超越能力边界:自进化 LLM 代理的零阶优化
Beyond the Capability Boundary: Zeroth-Order Optimization for Self-Evolving LLM Agents
摘要
自进化方法通过从底层 LLM 中采样轨迹并从这些轨迹中学习来提高 LLM 代理的能力。然而,这些方法很难超越智能体固有的能力边界进行学习,因为智能体无法在困难的示例上采样正确的轨迹以进行进一步的改进。在本文中,我们提出了一种零阶自进化框架,该框架使智能体能够通过扰动 LLM 参数来超越其能力边界,以适应困难的示例,而无需任何轨迹注释。具体来说,我们扰动 LLM 的 LoRA 参数,运行代理,计算扰动参数和原始参数下的损失,并使用损失差来估计梯度并进一步更新 LoRA 参数。我们使用更新后的 LLM 进行轨迹采样,以实现监督 微调 突破智能体的能力边界,形成一个封闭的自进化循环。我们引入并行扰动推理机制和自适应查找机制来减少零阶优化中的时间消耗,并提供平滑稳定的零阶损失值的答案困惑度损失。对多个深度研究基准的实验表明,我们的方法获得了显着更成功的轨迹,并且始终优于强大的基线,尤其是在困难的例子上。代码和发布的工件可在 https://github.com/hidk1911/ZOForLLMAgents 上找到。