论文

M3-BENCH:混合动机博弈中LLM代理社会行为的过程感知评测

M3-BENCH: Process-Aware Evaluation of LLM Agents Social Behaviors in Mixed-Motive Games

智能体系统Agent任务评测

摘要

随着大语言模型(LLM)智能体能力的不断提高,他们的高级社会行为,如合作、欺骗、共谋等,需要系统的评估。然而,现有的基准通常强调单一的能力维度或仅依赖于行为结果,而忽略了来自代理决策推理和沟通交互的丰富过程信息。为了解决这一差距,我们提出了 M3-Bench,这是一种混合动机游戏的多阶段基准,以及一个过程感知评估框架,该框架跨三个模块进行协同分析:BTA(行为轨迹分析)、RPA(推理过程分析)和 CCA(通信内容分析)。此外,我们整合大五人格模型和社会交换理论,将多维证据聚合成可解释的社会行为肖像,从而描述代理人的人格特质和能力概况,而不仅仅是简单的任务分数或基于结果的指标。实验结果表明,M3-Bench 能够可靠地区分模型之间的不同社会行为能力,并揭示了一些模型实现了看似合理的行为结果,但在推理和沟通方面却表现出明显的不一致。