论文
经Trace驱动的通用任务多模型智能体AI系统表征
Characterization of Multi-Model Agentic AI Systems on General Tasks via Trace-Driven Simulation
摘要
代理人工智能通过迭代规划、工具使用和基于观察结果的推理来完成任务。尽管它很受欢迎,但它的系统级行为仍然知之甚少,特别是对于复杂的数据集和代理架构——由于高度不确定的执行、过高的评估成本以及对专有模型的有限可见性。本文介绍了 GAIATrace,这是两个运行 GAIA 的最先进代理系统(MiroThinker 和 OWL)的第一个令牌级跟踪数据集,GAIA 是由通用任务的异构组合组成的基准。与之前的跟踪数据集不同,GAIATrace 捕获完整的推理标记、任务级结构以及每个主要参与的大语言模型的活动,从而实现深入的系统研究。为了补充数据集,我们推出了 Vidur-Agent,这是一种跟踪驱动的模拟器,可以重播 GAIATrace,以在不同的模拟环境中执行可重复的、低成本的系统评估。使用这两个工件,我们描述了现代代理系统如何处理一般任务以及各种系统设计选择如何塑造其行为,从而产生了一些独特的发现。
