论文
基于Agent博弈与自适应树状GRPO的对话模型优化
Dialogue Model Optimization via Agent Game and Adaptive Tree-based GRPO
摘要
开放式对话智能体旨在通过适应用户特质提供有吸引力、个性化的交互,但现有方法面临关键局限:过度依赖预先收集的用户数据,以及强化学习(RL)中忽视长期对话价值的短视偏差。为解决这些问题,我们提出一个新颖的长程RL框架,将在线个性化与自适应树状组相对策略优化(Adaptive Tree-based Group Relative Policy Optimization,AT-GRPO)相结合。该框架采用双智能体博弈范式:用户智能体通过风格模仿(学习用户特定的会话特质)与主动终止(预测轮级终止概率作为即时奖励)构建动态环境,形成迭代循环,驱动对话智能体深化兴趣探索。AT-GRPO将对话轨迹重新解释为树,并引入自适应观测范围:不同于带来指数开销的完全树展开,它限制每个节点只聚合来自阶段感知范围的奖励——较大范围支持早期话题探索,较小范围则有助于后期对话维持。该设计把rollout预算从对话长度的指数级降为多项式级,同时保留长期奖励捕获。大量实验表明,我们的框架在性能、样本效率与鲁棒性上均表现优越。
