论文
InfoPO:面向以用户为中心智能体的信息驱动策略优化
InfoPO: Information-Driven Policy Optimization for User-Centric Agents
摘要
现实世界用户对LLM智能体的请求常常欠规定。智能体必须通过交互获取缺失信息并做出正确的下游决策。然而,当前基于多轮GRPO的方法往往依赖轨迹级奖励计算,导致贡献归因问题和rollout组内优势信号不足。一种可行方法是在细粒度上识别有价值的交互轮次,以驱动更有针对性的学习。为此,我们提出InfoPO(Information-Driven Policy Optimization),它把多轮交互框定为一个主动降低不确定性的过程,并计算信息增益奖励,与屏蔽反馈的反事实相比,奖励那些其反馈可度量地改变智能体后续动作分布的轮次。随后,它通过自适应方差门控融合把该信号与任务结果结合,在识别信息重要性的同时保持面向任务的目标方向。在意图澄清、协作编码和工具增强决策等多样任务上,InfoPO持续优于提示方法和多轮RL基线。它在用户模拟器偏移下也表现出稳健性,并能有效泛化到环境交互任务。总体而言,InfoPO为优化复杂的智能体-用户协作提供了有原则且可扩展的机制。代码见 https://github.com/kfq20/InfoPO。
