论文
智能体到底做了什么?长期的循证监督智能体
What Did the Agent Actually Do? Evidence-Grounded Oversight for Long-Horizon Agents
摘要
随着智能体承担长期任务,用户从做出个人决策转变为监督自主执行。然而,智能体的活动量和支持证据的分散性使得很难确定哪些决策值得用户验证做出。我们研究监控器来识别后续决策并找到证据以帮助用户评估其影响。我们引入 AgentMonBench,这是一个软件工程基准测试,由三个子集组成,涵盖两个互补的维度:需求和行为之间的一致性,以及对验证相应自主决策的认识。为了支持这些判断,我们提出了基于证据的行为图(EBG),这是一种无需训练方法,它将与源相关的证据分组为行为并将它们的关系组织成一个图。 EBG 提供了该图的面向任务的视图,以帮助监控者解释上下文中的行为。八个模型的实验表明,与直接访问原始上下文相比,EBG 在大多数情况下改进了决策识别和证据定位。进一步的实验表明,EBG 的证据本地化收益在输入尺度和超参数设置中持续存在,而现实世界的应用则说明了其对人类监督的实际价值。
