论文

最后一步很重要:早期的不确定性无法预测长期代理的失败

Last Step Matters: Early Uncertainty Cannot Predict Failure in Long-Horizon Agents

智能体系统Agent任务评测

摘要

早期故障预测对于长期智能体非常重要,因为它可以及时进行干预,并可以降低推理和工具使用成本。不确定性量化,例如言语信心和困惑度,为检测代理故障提供了一种有前景的方法;然而,尚未探讨这些信号在长期执行的中间阶段是否保留其辨别力。我们评估了深度研究任务中的主流不确定性信号,发现言语置信度能够可靠地区分轨迹完成时的失败,平均 AUROC 为 0.85,而所有评估的信号在执行早期提供的预测价值有限,在 50% 轨迹进度时,平均 AUROC 均不超过 0.60。我们确定了解释这种差距的潜在机制:路径切换,代理经常放弃当前的轨迹内搜索方向,打破早期信号和最终结果之间的联系。这些发现挑战了中间不确定性可以可靠地指导早期干预的假设。它们还激发了在深度研究环境中对代理利用的实用建议:使用最后一步的置信度来决定是否重新启动,我们的实验发现这种方法比轨迹内干预更有效。