论文

高波动性和行动偏差将 LLM 与人类在群体协调中区分开来

High Volatility and Action Bias Distinguish LLMs from Humans in Group Coordination

模型评测模型行为与机制分析

摘要

人类表现出非凡的群体协调能力。随着 大语言模型 (LLM) 的能力变得越来越强,它们是否能够表现出可比的适应性协调以及它们是否使用与人类相同的策略仍然是一个悬而未决的问题。为了更好地理解这一点,我们比较了 LLM 和人类在监控不完善的共同兴趣游戏上的表现:组二分搜索。在这个$n$玩家的游戏中,参与者需要协调他们的行动以实现共同的目标。玩家独立提交数值,以求和到随机分配的目标数字。在没有直接沟通的情况下,他们依靠小组反馈来迭代调整他们的提交内容,直到达到目标数量。我们的研究结果表明,与随着时间的推移适应并稳定其行为的人类不同,LLM 往往无法在游戏中取得进步,并表现出过度的切换,从而损害群体收敛。此外,更丰富的反馈(例如数值误差幅度)对人类有很大好处,但对 LLM 的影响很小。最后,我们证明 GRPO 可以有效减少过度切换。总而言之,通过以人类基线和机制级指标(包括反应性缩放、切换动态和跨游戏学习)为基础进行分析,我们指出了人类和 LLM 组之间的差异,并为缩小协调差距提供了基于行为的诊断。