论文

Agent Island:源自多智能体博弈的抗饱和抗污染基准

Agent Island: A Saturation- and Contamination-Resistant Benchmark from Multiagent Games

智能体系统Agent任务评测

摘要

静态能力基准饱受饱和与污染之苦,难以追踪能力随时间的进展。我们提出Agent Island:一个多人仿真环境,语言模型智能体在其中进行智能体间合作、冲突与说服的博弈。该环境产生一个旨在缓解饱和与污染的动态基准:在这个赢者通吃的博弈中,新模型总能超越当前领先者,且智能体与其他自适应智能体竞争,而非面对固定任务集。我们以贝叶斯Plackett-Luce模型为玩家排名,量化玩家技能的不确定性。在49个独特模型参与的999局博弈中,openai/gpt-5.5以后验均值技能5.64主导同伴,第二名openai/gpt-5.2为3.10,第三名openai/gpt-5.3-codex为2.86。我们发布博弈日志作为数据集供行为分析。作为示例,我们调查终轮投票中的同源偏好:模型支持同厂商决赛选手的可能性高8.3个百分点;该偏好在厂商间不均——在分别估计的厂商中,OpenAI模型最强、Anthropic模型最弱。

Agent Island:源自多智能体博弈的抗饱和抗污染基准:论文配图
图 1:五个焦点模型的配对头对头统计数据。左:Cliff 的 δ\delta — 技能排序的后验认知置信度,值为 [−1,1][-1,1]。右:Plackett–Luce 预测的面对面胜率 𝔼⁡[λA/(λA+λB)]∈[0,1]\mathbb{E}[\lambda_{A}/(\lambda_{A}+\lambda_{B})]\in[0,1]。单元格读作“A vs B”(行 vs 列)。