论文

ArenaFlow:从轨迹排名到开放式智能体强化学习的分层信用传播

ArenaFlow: From Trajectory Ranking to Hierarchical Credit Propagation for Open-Ended Agent RL

模型训练强化学习

摘要

强化学习在可验证领域显着改进了大型语言模型(LLM)代理,但仍然难以应用于开放式代理任务,其中解决方案多种多样,并且很难获得可靠的标量奖励。最近的成对评估方法通过用相对偏好代替逐点评分来缓解奖励歧视崩溃。然而,他们仍然将丰富的比较反馈压缩为单一的轨迹级奖励,从而模糊了决定性的中间步骤,并阻止成功的行为被整合为可重用的技能。我们提出了 ArenaFlow,一种用于开放式代理强化学习的分层信用传播框架。 ArenaFlow 利用基于锦标赛的相对排名来得出轨迹级别的奖励信号。每次比较都进一步配备了结构化反思性评估,揭示了三种类型的监督:关键成功步骤、可重用策略技能和检索技能的使用归因。在步骤层面,ArenaFlow 根据锦标赛生存深度将轨迹级优势传播到高置信度关键步骤,从而能够更有针对性地优化局部推理行为。在技​​能层面,ArenaFlow 根据组级使用归因来估计技能效用,并通过效用感知更新、修剪和检索来维护全局技能记忆。由此产生的高实用性技能进一步作为未来探索的政策先决条件。大量实验验证了 ArenaFlow 在开放式代理任务上的有效性。