论文

CRAFT:部分信息下的扎根多智能体协调

CRAFT: Grounded Multi-Agent Coordination Under Partial Information

智能体系统Agent任务评测

摘要

我们引入了 CRAFT,一个多智能体基准,用于在严格的部分信息下评估 大语言模型 中的语用沟通。在这种情况下,具有互补但不完整视图的多个智能体必须通过自然语言进行协调,以构建一个共享的 3D 结构,而单个智能体无法完全观察到该结构。我们将这个问题形式化为多发送者有界语用说话者问题,并提供一个诊断框架,将故障分解为空间基础、信念建模和语用沟通错误,包括前沿模型和开放权重模型中行为故障概况的分类。在一系列不同的模型中,包括 8 个开放权重模型和 7 个包含推理模型的前沿模型,我们发现更强的推理能力并不能可靠地转化为更好的协调:较小的开放权重模型通常匹配或优于前沿系统,而改进的个人沟通并不能保证成功的协作。这些结果表明,多智能体协调对于当前语言模型来说仍然是一个根本上未解决的挑战。我们的代码可以在 https://github.com/csu-signal/CRAFT 找到