论文
MERIT反馈引导LLM谈判者更好地讨价还价
MERIT Feedback Elicits Better Bargaining in LLM Negotiators
摘要
讨价还价常被视为一个逻辑竞技场,而非艺术或直觉问题,但大语言模型(Large Language Model,LLM)仍难以在其中应对自如,原因在于策略深度有限,且难以适应复杂的人为因素。现有基准很少能捕捉这一局限。为弥合这一缺口,我们提出一个以效用反馈为核心的框架。我们的贡献包括:(i)AgoraBench,一个覆盖九种具有挑战性的设定(如欺骗、垄断)的新基准,支持多样的策略建模;(ii)由效用理论导出的、与人类对齐且具有经济学依据的指标,通过智能体效用(agent utility)、谈判力(negotiation power)和获取比率(acquisition ratio)来实现,隐式地衡量谈判与人类偏好的契合程度;以及(iii)一个以人类偏好为基础的数据集及学习流水线,通过提示和微调两种方式增强 LLM 的议价能力。实验结果表明,基线 LLM 策略常常偏离人类偏好,而我们的机制显著提升了谈判表现,带来更深层的策略行为和更强的对手意识。
