论文

ATLAS:具有任务分布式多大语言模型支持者的自适应自我进化研究代理

ATLAS : Adaptive Self-Evolutionary Research Agent with Task-Distributed Multi-LLM Supporters

模型训练偏好优化

摘要

最近的多 LLM 代理系统在即时优化和自动问题解决方面表现良好,但许多系统要么在微调后保持求解器冻结,要么依赖静态偏好优化循环,这对于长期任务来说变得棘手。我们提出了 ATLAS(自适应任务分布式学习代理自我进化),这是一种任务分布式框架,它迭代开发轻量级研究代理,同时将补充角色委托给专门的支持代理,以进行探索、超参数调整和参考策略管理。我们的核心算法,进化直接偏好优化(EvoDPO),自适应更新阶段索引参考策略。我们为概念漂移下基于偏好的上下文强盗提供了理论上的遗憾分析。此外,还对一维 Burgers 方程的非平稳线性上下文老虎机和科学机器学习 (SciML) 损失重新加权进行了实验。这两个结果都表明,ATLAS 比静态单代理基线提高了稳定性和性能。

ATLAS:面向 EvoDPO 与自适应参考演化的多 LLM 训练框架
图1:ATLAS 工作流。ATLAS(Adaptive Task-distributed Learning for Agentic Self-evolution)在以下两者之间交替:(i)使用支持者智能体进行探索,以生成多样的候选和偏好数据集;(ii)EvoDPO 更新,包括 DPO 微调(由策略师引导)以及通过基于得分提升和 KL 预算的检查器(inspector)门控进行的参考模型晋升。