论文

CAPO:由价值评估器指导、与动作对齐的策略优化

CAPO: Critic-Guided Action-Aligned Policy Optimization for Advancing LLM Agent Capabilities

模型训练强化学习

摘要

强化学习(RL)已成为提高大语言模型(LLM)代理能力的关键技术。尽管 GRPO 等无需价值评估器的方法越来越流行,但我们认为基于价值评估器的方法仍然非常适合长期代理任务,因为它们的价值评估模型可以评估每个状态并将功劳分配给不同的决策。然而,基于价值评估器的代表性方法(例如 PPO)仍然以词元粒度组织价值估计、贡献分配和策略更新,而环境状态仅在代理完成完整操作后才发生变化。在这项工作中,我们提出了 CAPO,一种由价值评估器指导、与行动一致的策略优化方法,用于提升 LLM 代理能力。 CAPO 引入了两种行动一致的设计。首先,它使用价值评估模型估计动作边界处的状态值,并将相应的优势分配给完整的动作而不是单个词元。其次,CAPO 引入了一种新颖的动作感知策略比率,该策略比率通过长度校准聚合每个动作内的词元比率,以实现不同长度动作之间的一致更新。这两种设计有效地实现了细粒度的贡献分配和一致的策略更新,同时保持与 词元级 梯度计算的兼容。多跳 QA、学术论文搜索和文本世界动作任务的实验表明,CAPO 的性能始终优于代表性的 RL 方法。进一步的分析验证了这两种设计,并揭示了动作对齐优化如何改进多轮强化学习训练。我们希望这项工作为训练更有能力的 LLM 智能体提供一条实用的路径。