论文
SentinelBench:面向长时运行监控智能体的基准
SentinelBench: A Benchmark for Long-Running Monitoring Agents
摘要
人工智能代理越来越多地被要求执行几分钟、几小时或更长时间的工作。然而,代理行为的默认模型是连续操作:发出工具调用、刷新页面、搜索替代方案或以其他方式尝试强制取得进展。对于许多长期运行的任务来说,这是错误的方法,持续关注的策略可以更好地服务这些任务。相反,代理应该监视环境,注意外部事件何时可以取得进展,然后及时响应,而不会在等待时浪费资源。为了衡量此类任务的进度,我们引入了 SentinelBench,这是一个针对时间演变监控任务的开源基准。 SentinelBench 包含跨 10 个合成 Web 环境的 100 项任务,包括电子邮件、日历、财务、专业网络和娱乐。每个环境都公开一个实时 Web 界面并重播脚本化的事件序列,要求代理导航并推理其状态在脚下发生变化的网页。 SentinelBench 衡量任务完成情况、反应时间和资源使用情况,揭示响应能力和成本之间的权衡。我们报告三个模型和两个浏览器代理工具的结果,为未来的比较建立性能基线,并展示代理设计选择如何显着影响关键指标。总之,这些结果表明 SentinelBench 区分了代理行为中有意义的差异。
