论文

Role-Agent:经双角色演化引导LLM智能体

Role-Agent: Bootstrapping LLM Agents via Dual-Role Evolution

模型训练强化学习

摘要

尽管大型语言模型(LLM)智能体在复杂任务上表现出了强大的性能,但它们的学习往往受到低效的交互反馈和静态训练环境的限制,这阻碍了更广泛的泛化。为了解决这些限制,本文引入了角色代理,\textcolor{black}{一个框架},它利用单个 LLM 同时充当代理和环境,从而实现引导式协同进化。 Role-Agent 由两个协同组件组成:World-In-Agent (WIA) 和 Agent-In-World (AIW)。在 WIA 中,LLM 充当代理并预测每次行动后的未来状态;然后,预测状态和实际状态之间的一致性被用作过程奖励,鼓励环境感知推理。在 AIW 中,LLM 从失败的轨迹中分析失败模式,并检索具有相似失败模式的任务,从而重塑训练数据分布以进行有针对性的实践。多个基准测试的实验表明,Role-Agent 持续提高性能,与强基准相比,平均增益超过 4%。

Role-Agent:经双角色演化引导LLM智能体:论文配图
图 1:(a):静态环境提供稀疏且非特定的反馈,限制了智能体的探索; (b):合成环境会产生高昂的劳动力和运行时间成本; (c):所提出的角色代理使一种模型能够在代理和环境之间切换角色,以实现引导协同进化。