论文

对于长期Agentic任务的进化策略来说,异步几乎是免费的

Asynchronous Is Nearly Free for Evolution Strategies on Long-Horizon Agentic Tasks

模型训练强化学习Agentic RL

摘要

基于LLM的长视野Agentic后训练通常会受到执行轨迹生成的瓶颈:轨迹跨越许多交互回合,完成时间差异很大,同步更新障碍使速度更快的工作人员等待落后者。 LLM后训练中采用的异步强化学习通过消耗到达的轨迹来解决这种低效率问题,但引入了策略滞后和非策略优化。进化策略(ES)为LLM后训练提供了一种无反向传播的替代方案,但它依赖于大量的执行轨迹并且现有实践基本上保持同步。在这篇简短的论文中,我们介绍了有界陈旧异步 ES,并使用 Qwen2.5-7B-Instruct 在 Endless Terminals 基准测试上进行了演示。在三个评估种子中,自然 Async-1 与同步 ES 相匹配,取得了 25.9% 的成功率,而留出的成功率为 25.4%。在没有明确的非策略校正的情况下,将每个更新队列的 10\% 延迟 4 个或 8 个策略更新的受控计划仅分别将成功率降低 1.6 和 3.1 个百分点。 GRPO 总体表现更好,达到了 29.0\% 留出成功率,但重要的是,我们的结果表明 ES 可以容忍适度的策略陈旧性,并且降级有限,为未来使用异步算法改进基于 ES 的后训练提供了可能性。据我们所知,我们是第一个在多轮终端样式Agentic编码任务上演示同步和异步 ES 的有效性的人。

对于长期Agentic任务的进化策略来说,异步几乎是免费的的原论文方法或结果图
图 1:带有 $G=4$ 工作线程和更新队列大小 $N=8$ 的同步和自然异步 ES 的图示。同步 ES 在更新之前等待最慢的扰动,从而使速度较快的工作线程闲置。第八次完成评估后自然异步 ES 更新,而未完成的扰动仍在进行中;这些结果返回时策略滞后为 1。