论文
合作档案预测多智能体 LLM 团队在科学工作流程 AI 中的表现
Cooperative Profiles Predict Multi-Agent LLM Team Performance in AI for Science Workflows
摘要
由 大语言模型 (LLM) 团队构建的多智能体系统越来越多地用于协作科学推理和问题解决。这些系统要求代理在共享约束下进行协调,例如 GPU 或信用余额,其中合作行为很重要。行为经济学提供了丰富的游戏工具包,可以隔离不同的合作机制,但仍不清楚模型在这些程式化设置中的行为是否可以预测其在现实协作任务中的表现。在这里,我们对 6 个行为经济学游戏中的 35 个开放权重 LLM 进行了基准测试,结果表明,游戏衍生的合作配置文件可以稳健地预测人工智能科学任务中的下游性能,其中 LLM 代理团队在共享预算约束下协作分析数据、构建模型并生成科学报告。有效协调游戏并投资于乘法团队生产(而不是贪婪策略)的模型可以在三个结果(准确性、质量和完成度)上产生更好的科学报告。这些关联在控制多个因素后成立,表明合作处置是 LLM 的一个独特的、可测量的属性,不能简化为一般能力。因此,我们的行为游戏框架提供了一种快速且廉价的诊断方法,用于在昂贵的多代理部署之前筛选合作适应性。