开源项目

Minigames Benchmark 用统一画面和时间节奏评测视觉操作Agent

A benchmark of seventy minigames for computer use agents, testing a variety of skills. Think your agent can beat them all?

智能体系统Agent任务评测

概述

Minigames Benchmark 面向 computer-use Agent,游戏核心为Rust,运行器为Python,采用Apache-2.0许可。每个任务显示640×480画面,Agent只能观察图像并用鼠标键盘动作完成目标。仓库提供70种游戏的目录与能力标签,涵盖视觉计数、迷宫规划、碰撞推断及连续控制。评测将游戏和Agent放在不同容器中,主机显示环境不参与,记录seed与实际输入供重放核对。统一游戏时间上限三分钟;完成任务计分,耗时单列而不混入分数。标准方案包含每次F1推进3tick、6/20/60tick每秒四种节奏,逐tick模式还需配置空闲及总超时,防止Agent永不推进时间。用户构建Rust游戏及Python扩展,用Podman或Docker启动容器,将自己的Agent命令接入运行器;附带harness只是每轮截图、请求OpenAI-compatible模型并执行返回的pyautogui代码,没有记忆。仓库没有足以支持模型优劣排名的对比结果;首发价值是可复用任务和评测接口,测试环境以Linux容器为主。