论文
用于协同决策与性能优化的强化学习增强 LLM Agent
Reinforcement Learning-Augmented LLM Agents for Collaborative Decision Making and Performance Optimization
摘要
大语言模型(LLM)在语言任务上表现良好,但往往缺乏协作意识,难以在多智能体环境中优化全局性能。我们提出一个强化学习增强的 LLM 智能体框架,将协作形式化为分散式部分可观测马尔可夫决策过程(Dec-POMDP),并采用集中训练、分散执行(CTDE)。我们引入组相对策略优化(GRPO),在训练中借助全局信号联合优化各智能体策略,并辅以一个平衡任务质量、速度与协作成本的简化联合奖励。在协作写作与编程基准上,该框架相对单智能体基线实现 3 倍的任务处理速度提升,写作的结构/风格一致性达 98.7%,编程测试通过率为 74.6%。该方法持续优于强大的多智能体 LLM 基线,为复杂工作流中的可靠协作提供了一条可行路径。