论文
SocialGrid:面向具身多智能体系统中规划与社会推理的基准
SocialGrid: A Benchmark for Planning and Social Reasoning in Embodied Multi-Agent Systems
摘要
随着大语言模型(LLM)从文本处理器转变为自主智能体,在具身多智能体环境中评估其社会推理能力变得至关重要。我们提出SocialGrid,一个受游戏Among Us启发的具身多智能体环境,从规划、任务执行和社会推理三方面评估LLM智能体。我们的评估显示,即使最强的开放模型(GPT-OSS-120B)在任务完成和规划上的准确率也不足60%,智能体会陷入重复行为或无法通过基本障碍。由于糟糕的导航会混淆对社会智能的评估,SocialGrid提供可选的Planning Oracle(规划神谕),将社会推理与规划缺陷分离开来。尽管规划辅助提升了任务完成率,社会推理仍是瓶颈:无论规模大小,智能体识别欺骗的表现都接近随机水平,依赖浅层启发式而非积累行为证据。SocialGrid提供自动失败分析和细粒度指标,帮助开发者诊断并改进其智能体。我们还基于对抗联赛的Elo评分建立了竞争性排行榜。
