论文

智能体到底做了什么?长期的循证监督智能体

What Did the Agent Actually Do? Evidence-Grounded Oversight for Long-Horizon Agents

智能体系统Agent 动作执行与治理

摘要

随着智能体承担长期任务,用户从做出个人决策转变为监督自主执行。然而,智能体的活动量和支持证据的分散性使得很难确定哪些决策值得用户验证做出。我们研究监控器来识别后续决策并找到证据以帮助用户评估其影响。我们引入 AgentMonBench,这是一个软件工程基准测试,由三个子集组成,涵盖两个互补的维度:需求和行为之间的一致性,以及对验证相应自主决策的认识。为了支持这些判断,我们提出了基于证据的行为图(EBG),这是一种无需训练方法,它将与源相关的证据分组为行为并将它们的关系组织成一个图。 EBG 提供了该图的面向任务的视图,以帮助监控者解释上下文中的行为。八个模型的实验表明,与直接访问原始上下文相比,EBG 在大多数情况下改进了决策识别和证据定位。进一步的实验表明,EBG 的证据本地化收益在输入尺度和超参数设置中持续存在,而现实世界的应用则说明了其对人类监督的实际价值。

智能体到底做了什么?长期的循证监督智能体的原论文方法或结果图
图 1:长期工作流程中的用户监督。这个说明性研究示例将数据排除与其含义和支持证据联系起来。 AgentMonBench 评估软件工程中的这些监督需求,而 EBG 则组织监控证据。