论文

代理的第一天:职场场景中学习、探索与调度的基准评测

The Agent's First Day: Benchmarking Learning, Exploration, and Scheduling in the Workplace Scenarios

智能体系统Agent任务评测

摘要

多模态大语言模型(MLLM)的快速演进推动了工作流自动化;然而,现有研究主要针对静态环境中的性能上界,忽视了随机性真实部署中的鲁棒性。我们识别出三个关键挑战:动态任务调度、不确定性下的主动探索,以及从经验中持续学习。为弥合这一差距,我们提出一个动态评测环境,模拟一个在新环境中持续探索的“实习生”代理。与传统基准不同,该环境沿三个维度评测代理:(1)对具有不同优先级的流式任务进行上下文感知调度;(2)通过主动探索进行审慎的信息获取以减少幻觉;(3)通过从基于规则、动态生成的任务中蒸馏泛化策略实现持续进化。实验表明,前沿代理在动态环境中存在显著缺陷,尤其是在主动探索与持续学习方面。我们的工作建立了一个评估代理可靠性的框架,把评测从静态测试转向面向生产的现实场景。代码发布于 https://github.com/KnowledgeXLab/EvoEnv

代理的第一天:职场场景中学习、探索与调度的基准评测
图1:当前智能体系统面临的挑战总览:(1) 针对流式任务输入的有效调度与多任务规划;(2) 怀疑任务不可解并通过主动探索寻求指导的能力;(3) 鲁棒的经验总结、检索与利用,以增强性能稳定性。