论文

学习销售:多产品市场中战略性大语言模型Agent的强化学习

Learning to Sell: Reinforcement Learning for Strategic Large Language Model Agents in Multi-Product Markets

模型训练强化学习RLVRAgentic RL

摘要

在多产品市场中运行的自主大语言模型(LLM)Agent必须在信息不对称和资源限制下做出顺序决策。我们开发了一种机器学习方法,用于训练此类Agent在多项目讨价还价环境中有效地充当卖家,其中卖家同时在独立买家池中协商可替代资产的目录。买家对各种产品持有私人的、异质的估值,每个人最多只能购买一件商品。面对总沟通次数的限制,卖方必须考虑买方的私人估值,动态地将买方与最有利可图的产品匹配,同时战略性地将其有限的互动预算分配给具有更大潜在价值的组合。我们使用结构化的四部分消息协议将这个问题形式化为部分可观察马尔可夫决策过程,该协议将自然语言映射到可解析和受监管的决策空间。利用这种形式化,我们使用可验证奖励的强化学习(RLVR)设计了一种后训练方法。为了评估这个框架,我们构建了一个多维度量套件,用于量化约束遵守情况、卖方剩余提取和分配质量。我们训练有素的卖方Agent学会更有效地将有限的库存与买方相匹配,在卖方剩余提取和买方产品分配质量方面匹配或超越万亿参数前沿模型。最后,这些学到的策略可以稳健地推广到训练期间未遇到的未见过的市场结构、相关估值分布和价格范围。