论文

智能体在 19:05 能看到什么?从实际研究中生成随时间变化的企业场景并重播它们以评估代理

What Could the Agent See at 19:05? Generating Temporal Enterprise Scenarios from Real Research and Replaying Them to Evaluate Agents

智能体系统Agent任务评测

摘要

企业人工智能代理在许多数据不断变化的应用程序中运行,因此答案仅相对于存在的数据以及在被询问时谁可以看到它而言才是正确的。今天的离线评估根据单个静态快照进行评分,这实际上是这一集的结束。因此,它只能评估一种情况,即最后一种情况,尽管该情节的每个早期时刻都是不同的情况,会引发自己的现实问题和自己的正确答案。将每个时刻重新创建为单独的快照意味着每个时刻重新配置整个租户,这是非常昂贵的;即使单个快照也会泄露隐藏在记录中的未来状态,并且无法代表实际工作发生的多应用程序、按时间顺序的方式。我们的系统立即弥补了两个差距:它根据真实研究生成一个现实的、角色驱动的、随时间变化的企业世界,并在任何选定的时刻重播该世界以评估任何可插入代理。模式推断的时间描述驱动每个记录过去状态的确定性加 LLM 重建;由于可查询的时刻是有限的,因此所有重建都被预先计算到紧凑的差异缓存中,从而使评估成为快速、可重复的查找,并且路径中没有模型。我们描述了设计、跨越两个流程的架构以及评估企业代理的早期经验。