论文

ArtifactArena:通过模型在物理世界中构建的内容来评估模型

ArtifactArena: Evaluating Models by What They Build in the Physical World

智能体系统Agent任务评测

摘要

为了评估前沿,我们必须根据模型在实际物理环境中能够设计和构建的内容来衡量模型,而不是根据它们所说的内容。我们引入了 \textsc{ArtifactArena},这是一个开放式平台,其中模型面临物理基础的硬件-软件协同设计挑战:设计功能齐全的机器人在模拟竞技场中竞争。我们通过三个Harness评估前沿模型的零样本、验证者引导的细化和开放式物理设计功能,这三个Harness根据文本描述、物理模拟器反馈和游戏数据来细化其机器人工件。我们通过前沿模型的 Elo 排名对这些功能进行基准测试,该排名源自其工件之间的面对面锦标赛。通过为正在进行的社区提交发布此框架和锦标赛基础设施,我们建立了一个活跃的、非饱和的测试平台,以持续测量物理世界中开放式智能不断扩大的极限。请访问 \href{https://artifactarena.ai}{https://artifactarena.ai} 了解更多信息。

ArtifactArena:通过模型在物理世界中构建的内容来评估模型的原论文方法或结果图
图 1:ArtifactArena:模型联合设计物理视觉定位的工件:机器人主体、控制器和 MuJoCo 中面对面竞争的策略。人工制品通过将对手推下高架环或将其按竞技场规则固定来获胜,从而根据模型所创造的物理性能进行评估。