论文

JarvisBench:人与智能体之间的常开智能

JarvisBench: Always-on Intelligence Between Humans and Agents

智能体系统Agent HarnessAgent任务评测长程任务评测

摘要

长时程智能体可以持续执行任务,但人类注意力仍是间歇性且稀缺的。这产生了一个双向协调问题:用户可能需要在后台工作继续进行时立即访问智能体,而智能体可能在用户停止监控执行之后遇到需要用户判断的关键决策。我们提出一个常开的注意力协调层——Jarvis(得名于《钢铁侠》中的虚构AI助手)——来调解这一接口,并将人类注意力分配给一个或多个工作中的智能体。我们引入JarvisBench来评估这种协调的双向能力:中介能否准确、及时地回答用户发起的关于正在进行工作的问题,以及它能否识别智能体何时需要用户判断、在恰当时刻征求该判断并将其回传以改善任务结果。JarvisBench包含45个智能体任务实例:20个单智能体任务和25个组织成10个多智能体项目的工作流。任务覆盖19个领域,从2,000多个公开候选中筛选和改编而来。关键在于,对用户注意力的需求是在执行过程中自然产生的,而非来自初始提示中明显的遗漏。JarvisBench设计为可集成到任意智能体运行时而不修改其底层执行循环。我们的参考实现还提供全双工语音接口,让用户能自然地联系Jarvis,同时及时的注意力协调支持在后台工作的智能体。通过将智能体执行与注意力协调分离,JarvisBench在智能体能力持续提升的情况下提供了一个稳定的评估目标。

JarvisBench:人与智能体之间的常开智能:论文配图
图1:JarvisBench 概览。Jarvis 提供始终在线的用户交互接口,并通过任务事件和注意力请求来协调用户注意力与冻结的智能体运行时。