论文

多买家市场中的战略讨价还价:从 LLM 谈判的可验证奖励中进行强化学习

Strategic Bargaining in Multi-Buyer Markets: Reinforcement Learning from Verifiable Rewards for LLM Negotiations

模型训练强化学习

摘要

谈判是管理科学中的一种基本战略互动,其特点是智能体试图达成协议,同时保护私人信息,例如保留成本和隐藏估值。一个普遍而复杂的场景涉及单个卖方同时与多个买方进行谈判,每个买方都拥有不同的私人预算。在这种情况下,由于沟通次数有限,卖方必须在探索更广阔的市场以发现最高估值与将足够的沟通集中在单个目标买家身上以确保获得最佳结果之间取得平衡。我们的分析揭示了标准 大语言模型 (LLM) 的显着差距:虽然这些模型在语言上很熟练,但它们无法充当有效的经济决策者。具体来说,他们未能探索买家池,常常关注当前的最高出价,而不是战略性地调查市场以发现潜在的高估值。在本文中,我们提出了一种使用可验证奖励强化学习(RLVR)的专门训练方法。通过将奖励函数与客观经济成果挂钩,市场发现和剩余提取之间的战略平衡会在学习过程中自然出现。我们的结果表明,经过训练的卖家经历了多阶段的战略演变,学习利用价格锚定和战略探测来识别利润更高的交易对手。通过提高谈判技巧和不断与高价值买家达成交易,代理商获得了比前沿模型高得多的盈余。最后,我们表明我们的卖方策略可以稳健地推广到看不见的买方谈判风格和预算分配。