论文

用可验证奖励的强化学习教LLM谈判

Instructing LLMs to Negotiate using Reinforcement Learning with Verifiable Rewards

模型训练强化学习RLVRAgentic RL

摘要

大语言模型(LLM)的最新进展确立了其作为自主交互智能体的潜力。然而,它们在双边价格谈判等不完全信息策略博弈中常常表现挣扎。本文研究可验证奖励强化学习(RLVR)能否有效教会LLM谈判。具体而言,我们探索学习过程中涌现出的策略行为。我们提出一个框架,在广泛的真实商品分布上训练一个中型买家智能体与一个受约束的LLM卖家对抗。通过将奖励信号直接锚定于经济剩余最大化与严格遵守私人预算约束,我们揭示了一种新颖的四阶段策略演化。该智能体从朴素讨价还价进阶到使用激进的开价,经历僵局阶段,最终发展出成熟的说服技巧。结果表明,这种可验证训练使一个30B智能体在攫取剩余方面显著超越规模十倍于它的前沿模型。此外,训练后的智能体能稳健泛化到训练中未见过的更强对手,即使面对充满敌意的对抗性卖家角色也依然有效。

用可验证奖励的强化学习教LLM谈判:论文配图
图 1:与主要基线相比的奖励。主要优化目标 (RR)。当罕见的有利交易带来的高额奖励被大量 0.00.0 死锁惩罚所抵消时,就会出现短暂的平台期。当代理人学会理性让步和说服时,奖励恢复稳定向上攀升。图 2:与主要基线相比的买方讨价还价率。剩余提取效率的测量。早期的“沉没”(迭代 12-20)显示出由于激进的低价提议而导致的暂时僵局。随着智能体学习高级说服力,该比率通过迭代 60 恢复稳定恢复。