论文

PieArena:前沿语言代理实现 MBA 级别的谈判表现并揭示新的行为差异

PieArena: Frontier Language Agents Achieve MBA-Level Negotiation Performance and Reveal Novel Behavioral Differences

智能体系统Agent任务评测

摘要

我们对大语言模型的谈判能力进行了深入评估,这是一项需要战略推理、思维理论和经济价值创造的核心业务任务。为此,我们引入了 PieArena,这是一个大规模谈判基准,基于来自精英商学院 MBA 谈判课程的现实场景中的多代理交互。我们发现了 AGI 级别表现的系统证据,其中代表性的前沿特工 (GPT-5) 与训练有素的商学院学生相匹配或优于他们,尽管在执行任务之前接受了一个学期的一般谈判指导和有针对性的辅导。我们进一步研究了联合意向代理支架的效果,并发现了不对称收益,中层和低层 LM 的收益大幅提高,而前沿 LM 的收益递减。除了交易结果之外,PieArena 还提供了多维谈判行为概况,揭示了新颖的跨模型异质性,这些异质性被仅交易结果的基准所掩盖,包括欺骗、计算准确性、指令合规性和感知声誉。总体而言,我们的结果表明,前沿语言智能体在智力和心理上已经具备在高风险经济环境中部署的能力,但鲁棒性和可信度方面的缺陷仍然是开放的挑战。

PieArena:在真实谈判场景中对语言智能体进行排名与画像
图2:带有Shared-Intentionality Harness的Agent交互框架。在每一轮中,以base或pro模式运行的agent都以相同的场景上下文和累积对话记录为条件。pro agent额外调用共享意向性状态跟踪和策略规划作为引导消息生成的脚手架。对手方遵循相同的、角色互换的流水线;谈判动态源于两个agent通过消息交换的耦合交互。