论文

SocialGrid:面向具身多智能体系统中规划与社会推理的基准

SocialGrid: A Benchmark for Planning and Social Reasoning in Embodied Multi-Agent Systems

智能体系统Agent任务评测

摘要

随着大语言模型(LLM)从文本处理器转变为自主智能体,在具身多智能体环境中评估其社会推理能力变得至关重要。我们提出SocialGrid,一个受游戏Among Us启发的具身多智能体环境,从规划、任务执行和社会推理三方面评估LLM智能体。我们的评估显示,即使最强的开放模型(GPT-OSS-120B)在任务完成和规划上的准确率也不足60%,智能体会陷入重复行为或无法通过基本障碍。由于糟糕的导航会混淆对社会智能的评估,SocialGrid提供可选的Planning Oracle(规划神谕),将社会推理与规划缺陷分离开来。尽管规划辅助提升了任务完成率,社会推理仍是瓶颈:无论规模大小,智能体识别欺骗的表现都接近随机水平,依赖浅层启发式而非积累行为证据。SocialGrid提供自动失败分析和细粒度指标,帮助开发者诊断并改进其智能体。我们还基于对抗联赛的Elo评分建立了竞争性排行榜。

SocialGrid:面向具身多智能体系统中规划与社会推理的基准:论文配图
图 1:SocialGrid 概述。受我们之中的启发,SocialGrid 是一个可控的、具体化的基准测试,用于评估多主体、多目标环境中的 LLM 主体。 (左)用户输入:实现对环境复杂性(例如地图面积、房间数量)和代理配置的系统控制。 (中)环境:智能体在物理限制下运行;可选的规划预言机将社交推理与导航隔离开来。 (右)评估和反馈:提供跨空间、任务和社交轴的多维指标,以及自动故障分析和基于联盟的 Elo 排名。有关可视化屏幕截图,请参阅附录 A。