论文

Social Gym 和 SPaRTan:通过多智能体游戏锦标赛对 LLM 社交推理进行基准测试和改进

Social Gym and SPaRTan: Benchmarking and Improving LLM Social Reasoning via Multi-Agent Game Tournaments

智能体系统Agent任务评测

摘要

LLM 智能体越来越多地部署在多智能体社交环境中,它们必须与其他智能体合作、协商和适应。衡量和提高这些社交技能很困难,因为与数学或逻辑不同,社交互动不提供客观的 真值:评估依赖于 LLM 法官,而法官成本高昂、主观且嘈杂,并且模型无法获得可靠的信号来学习。为了解决这两个问题,我们首先引入 Social Gym,这是一个包含 21 种多智能体社交游戏(例如,狼人、抵抗、Spyfall)的环境,其规则决定的结果使智能体的表现可验证且客观,并通过 Elo 锦标赛产生跨游戏排行榜。基准测试实验表明,虽然 GPT-5-mini 在排行榜上名列前茅,但没有任何模型在所有游戏或所有游戏角色中都表现出色,这表明了社交推理的局限性。受此启发,我们还提出了 SPaRTan(自我游戏和反射转移),这是一种 无需训练 自我改进循环:模型玩游戏,反思其轨迹及其结果以生成可转移的剧本,并将该剧本应用于后续游戏中。我们的结果表明,SPaRTan 剧本可以帮助 GPT-5-mini 智能体提高较弱角色的性能,但很大程度上不会提高 Qwen3-32B 的性能。 Social Gym 和 SPaRTan 共同为测量和改进 LLM 社交推理提供了可重复、可验证的基础,无需权重更新。