论文
Agent Island:源自多智能体博弈的抗饱和抗污染基准
Agent Island: A Saturation- and Contamination-Resistant Benchmark from Multiagent Games
摘要
静态能力基准饱受饱和与污染之苦,难以追踪能力随时间的进展。我们提出Agent Island:一个多人仿真环境,语言模型智能体在其中进行智能体间合作、冲突与说服的博弈。该环境产生一个旨在缓解饱和与污染的动态基准:在这个赢者通吃的博弈中,新模型总能超越当前领先者,且智能体与其他自适应智能体竞争,而非面对固定任务集。我们以贝叶斯Plackett-Luce模型为玩家排名,量化玩家技能的不确定性。在49个独特模型参与的999局博弈中,openai/gpt-5.5以后验均值技能5.64主导同伴,第二名openai/gpt-5.2为3.10,第三名openai/gpt-5.3-codex为2.86。我们发布博弈日志作为数据集供行为分析。作为示例,我们调查终轮投票中的同源偏好:模型支持同厂商决赛选手的可能性高8.3个百分点;该偏好在厂商间不均——在分别估计的厂商中,OpenAI模型最强、Anthropic模型最弱。
