论文

CollabSim:一种基于 CSCW 的方法,用于通过受控多智能体实验研究 LLM 智能体的协作能力

CollabSim: A CSCW-Grounded Methodology for Investigating Collaborative Competence of LLM Agents through Controlled Multi-Agent Experiments

智能体系统Agent任务评测

摘要

基于 大语言模型 构建的多代理系统 (MAS) 已显示出越来越大的前景,其有效性取决于代理通过基于文本的渠道进行协调的能力,就像人类团队所做的那样。然而最近的研究表明,MAS 常常出现问题,并不是因为Agent缺乏个人解决任务的能力,而是因为他们缺乏协作能力:建立共同点、维持共同任务理解、平衡个人和集体激励以及在互动展开时修复失调的能力。数十年的计算机支持协作工作研究已经描述了人类团队在受限通信下进行协调的这些要求,但现有的 MAS 评估主要侧重于任务结果或单智能体在推理、规划和工具使用方面的熟练程度。为了能够对 MAS 中的智能体协作能力进行系统分析,我们引入了 CollabSim,这是一个可配置的模拟框架,它结合了基于理论的协作能力定义、交互条件的受控操纵以及智能体内部状态的动作级探测。四个 LLM 的实验表明,CollabSim 可以捕获条件效应、分离模型性能模式并揭示代理设计的任务相关效应。