论文
以行为Agentic优化推进主动式Agent的Pareto前沿
Pushing Forward Pareto Frontiers of Proactive Agents with Behavioral Agentic Optimization
摘要
主动式大语言模型 (LLM) 代理旨在主动规划、查询和多轮交互,从而实现超越被动指令跟随的高效任务完成,并使它们对于现实世界、以用户为中心的应用程序至关重要。代理强化学习(RL)最近成为在多轮设置中训练此类代理的有前景的解决方案,允许从反馈中学习交互策略。然而,现有的管道在平衡任务性能和用户参与度方面面临着严峻的挑战,因为被动代理无法有效地适应用户的意图,而过度使用人类反馈会降低他们的满意度。为了解决这种权衡问题,我们提出了 BAO,这是一种代理 RL 框架,它将行为增强与行为正则化相结合,以丰富主动推理和信息收集能力,以抑制低效或冗余的交互,并使代理行为与用户期望保持一致。我们在 UserRL 基准套件中的多项任务上评估了 BAO,并证明它的性能大大优于主动代理 RL 基线,同时实现了与商业 LLM 代理相当甚至更优越的性能,突出了其在复杂的多回合场景中训练主动、用户一致的 LLM 代理的有效性。我们的网站:https://proactive-agentic-rl.github.io/。
