论文
小语言模型能学会谈判吗?受过 RL 培训的卖家的受控规模研究
Do Small Language Models Learn to Negotiate? A Controlled Scaling Study of RL-Trained Sellers
摘要
LLM智能体开始拥有完整的客户体验。很快,LLM可能会分别代表公司和客户进行销售和购买。小模型在规模上更具成本效益,但强化学习能否将它们训练成有能力的卖家?我们使用 GRPO 训练四台 Gemma 4 检查点(2.3B 到 31B 有效的参数),以进行双边多问题讨价还价的程序化实用奖励,并在与训练中从未见过的两个前沿买家的相同 1,152 次谈判中评估每支手臂。在每种尺寸的学习率 ($10^{-6}$) 相同的情况下,RL 模型相对于其基础的增益从 2.3B 的 $+0.001$ 上升到 31B 的 $+0.078$。每个尺寸都训练一次,两个最小的检查点使用不同的架构,因此我们不适合缩放法则。使用相同或更少的训练步骤将学习率提高三倍,将每个大小的共享率提高 $+0.032$ (2.3B) 到 $+0.081$ (4.5B)。在与作为卖家运行的两个前沿模型的探索性比较中,12B 卖家的训练率得分是两者的三倍,尽管其未经训练的基础得分已经与他们一样高。 4.5B 卖家在这个速度上与任何一个都没有明显的差异,并且适合一个 48 GB GPU。另一个 2.3B 臂以共享率的十倍提高了汇总分数,但其收益主要集中在与训练池共享型号系列的评估买家身上。这些结果建议在得出小模型无法学习谈判的结论之前调整学习率,并对来自多个模型系列的买家进行测试。