论文
用可验证奖励的强化学习教LLM谈判
Instructing LLMs to Negotiate using Reinforcement Learning with Verifiable Rewards
摘要
大语言模型(LLM)的最新进展确立了其作为自主交互智能体的潜力。然而,它们在双边价格谈判等不完全信息策略博弈中常常表现挣扎。本文研究可验证奖励强化学习(RLVR)能否有效教会LLM谈判。具体而言,我们探索学习过程中涌现出的策略行为。我们提出一个框架,在广泛的真实商品分布上训练一个中型买家智能体与一个受约束的LLM卖家对抗。通过将奖励信号直接锚定于经济剩余最大化与严格遵守私人预算约束,我们揭示了一种新颖的四阶段策略演化。该智能体从朴素讨价还价进阶到使用激进的开价,经历僵局阶段,最终发展出成熟的说服技巧。结果表明,这种可验证训练使一个30B智能体在攫取剩余方面显著超越规模十倍于它的前沿模型。此外,训练后的智能体能稳健泛化到训练中未见过的更强对手,即使面对充满敌意的对抗性卖家角色也依然有效。
