论文
Agentic能力层级:在真实RL环境中评测前沿模型
The Hierarchy of Agentic Capabilities: Evaluating Frontier Models on Realistic RL Environments
摘要
基于大语言模型(LLM)的代理的进展,已把AI评估从单轮回答评估转向交互环境中的多步任务完成。我们呈现一项实证研究,在来自Surge的真实电商RL环境中的150个职场任务上评测前沿AI模型。我们的分析揭示了一个实证导出的agentic能力层级,模型必须依次掌握方能投入真实部署:(1)工具使用,(2)规划与目标形成,(3)适应性,(4)扎根性(groundedness),(5)常识推理。即使表现最好的模型也有约40%的任务失败,失败沿该层级可预测地聚集。较弱模型在基本工具使用与规划上挣扎,而较强模型主要在需要超越显式指令的情境推断的任务上失败。我们提出一种以任务为中心的RL环境设计方法论,强调多样性与领域专家贡献,提供详细的失败分析,并讨论对代理开发的启示。我们的发现表明,尽管当前前沿模型能展现连贯的多步行为,要在真实职场环境中达到人类水平的任务完成,仍存在巨大能力差距。