论文

Agentick:面向通用序贯决策智能体的统一基准

Agentick: A Unified Benchmark for General Sequential Decision-Making Agents

智能体系统Agent任务评测

摘要

AI智能体研究横跨宽谱:从从零学习的RL智能体到利用预训练知识的基础模型智能体,却没有统一基准支持跨方法的公平比较。我们提出Agentick:面向序贯决策智能体的基准,在共同基础评估RL、LLM、VLM、混合与人类智能体,并为序贯决策的根本挑战研究供能。Agentick提供37个程序生成任务,横跨六能力类别、四难度级、五观测模态,全部经单一Gymnasium兼容接口暴露。基准附带编码API、全任务oracle参考策略、预建SFT数据集、可组合智能体harness与实时排行榜。跨27配置与9万余回合的评估揭示:没有单一方法占优——GPT-5 mini以0.309 oracle归一化分领先,PPO主导规划与多智能体任务;推理harness把LLM性能放大3-10倍;ASCII观测一致优于自然语言。这些发现凸显所有智能体范式仍有巨大改进空间。

Agentick:面向通用序贯决策智能体的统一基准:论文配图
图 1:中等难度的 KeyDoorPuzzle 的两种观察模式。左:VLM 代理、基于 CNN 的 RL 和人类游戏的等距像素渲染(默认为 512×\times512,可调整大小以进行 RL 预处理)。右:LLM 代理的 ASCII 网格;代理人(ˆ)必须收集金钥匙(Kg),打开金门(Dg),然后打开红钥匙(Kr)和红门(Dr)才能到达目标(G)。相同的状态还产生自然语言、结构化字典和 numpy 数组观察。