论文
IB-RL:面向策略型对话智能体的隔离双边强化学习
IB-RL: Isolated Bilateral Reinforcement Learning for Strategic Dialogue Agents
摘要
强化学习(RL)在改进大语言模型(LLM)处理具有平稳、可验证奖励的任务(如数学推理与代码执行)方面取得了强劲成果。在这些设置中,环境遵循固定规则,不会对智能体进行策略性适应。策略型对话在这一点上有所不同:环境是另一个会适应策略的智能体,成功取决于双方的交互。尽管具有这种交互性质,当前的RL方法通常针对固定的对手或模拟器训练目标智能体。我们发现这种训练范式促使策略利用对手特定的规律,而非学习可跨对手泛化的策略。我们将这一问题称为静态对手失配(static-counterpart mismatch),并在实验中直接对其量化。为解决它,我们提出隔离双边强化学习(Isolated Bilateral Reinforcement Learning, IB-RL),其中两个角色通过联合推演(joint rollouts)共同进化,同时每个角色通过完全独立的优势(advantage)、动作掩码与更新路径优化自身奖励。我们在两个领域中用冻结策略与完全独立的留出对手进行评估。在Vehicle TeleSales上,IB-RL达到89.6%的Success@1,而最佳单边RL基线为84.6%。在Deal-or-NoDeal上,它对DeepSeek V4 Pro达到98.4%的达成率,而最佳单边基线为86.4%。这些结果表明,以严格的每智能体隔离共同训练两个角色,能产生对未见对手泛化更有效的策略。
