论文

MERIT反馈引导LLM谈判者更好地讨价还价

MERIT Feedback Elicits Better Bargaining in LLM Negotiators

智能体系统Agent任务评测

摘要

讨价还价常被视为一个逻辑竞技场,而非艺术或直觉问题,但大语言模型(Large Language Model,LLM)仍难以在其中应对自如,原因在于策略深度有限,且难以适应复杂的人为因素。现有基准很少能捕捉这一局限。为弥合这一缺口,我们提出一个以效用反馈为核心的框架。我们的贡献包括:(i)AgoraBench,一个覆盖九种具有挑战性的设定(如欺骗、垄断)的新基准,支持多样的策略建模;(ii)由效用理论导出的、与人类对齐且具有经济学依据的指标,通过智能体效用(agent utility)、谈判力(negotiation power)和获取比率(acquisition ratio)来实现,隐式地衡量谈判与人类偏好的契合程度;以及(iii)一个以人类偏好为基础的数据集及学习流水线,通过提示和微调两种方式增强 LLM 的议价能力。实验结果表明,基线 LLM 策略常常偏离人类偏好,而我们的机制显著提升了谈判表现,带来更深层的策略行为和更强的对手意识。

MERIT反馈引导LLM谈判者更好地讨价还价
图1:LLM agent之间的谈判任务与AgoraBench概览。(a) 表示模拟器,(b) 表示人类偏好数据集,(c) 表示九个以经济学为依据的市场环境,每个环境围绕一种不同的消费品构建。