论文
SafeActBench:工具 Agent 从证据到行动为何失败
From Evidence to Action: How Tool-Using Agents Fail
摘要
使用工具的智能体会对外部状态做出相应的改变,但正确的结果并不能保证他们的行为得到事先建立的证据的支持。我们研究了当智能体从决定是否采取行动转向执行单个行动和相关工作流程时,这个证据到行动链在哪里断裂。在十种 Harness 配置中,强大的静态动作评估可以与较弱的交互式执行共存。失败往往在执行之前就开始了:智能体因调查不完整而停止,或在建立所需证据之前采取行动。一旦获得所需的证据,单操作执行通常是可靠的,而多操作工作流程还会暴露未解决的先决条件和不完整的执行。对于此分析,我们引入了 SafeActBench,其中包括跨越六个操作域的 656 个案例和五个协议,这些协议从静态动作判断和调查非动作发展到单动作和多动作工作流程。受来源限制的证据分类帐和确定性轨迹评估器跟踪建立了哪些信息、何时发生操作以及是否满足下游依赖性。这些结果表明,失败不仅源于信息缺失,还源于智能体在决策和执行行动时如何使用既定证据。
