论文

JarvisBench:度量长程智能体工作流中语音中介的双重价值

Just A Rather Very Intelligent Spoken Agent

智能体系统Agent HarnessAgent任务评测长程任务评测

摘要

长程AI智能体能力日益增强,但与用户的交互仍然单薄:多数工作流中用户给出初始指令后只收到选择性的文本更新,失去对智能体正在做什么、何时介入的清晰感知。这在当前智能体生态中留下一块缺失:一个常驻的Jarvis式中介,让智能体对用户持续可达。这样的中介应支持与用户的实时语音交互、不打断工作智能体地回答提问、主动报告进度或困惑、并在有用时把用户引导注入智能体的执行。本文提出JarvisBench,一个度量中介在长程智能体工作流中双重价值的基准,含两条互补轨道:智能体协作轨道度量中介是否改善下游任务完成,用户交互轨道度量中介是否让进行中的执行更可理解、更可响应、更可及。我们以模块化的参考Jarvis原型实例化该基准,并在OpenClaw中执行的34个纯文本WildClaw任务上评估。GPT-5.5、Claude Opus 4.7、Gemini与GPT系工作智能体的初步结果显示:Jarvis式中介能给出有轨迹依据的用户问答响应,并在恰当时机注入稀疏用户引导时改善任务表现;效果还强烈依赖中介的LLM大脑——既显示这一缺失中间层的前景,也表明需要更广泛的社区投入。演示页 https://cchen1436.github.io/jarvis。