论文
在智能体故障预测中将任务难度与运行级故障分开
Disentangling Task Difficulty from Run-Level Failure in Agent Failure Prediction
摘要
预测LLM智能体是否会失败已成为支持执行期间干预的一个有希望的方向。最近的方法报告了强大的预测性能,AUROC 值通常在 0.85 到 0.94 之间。然而,预测器通常是通过汇集许多任务的运行来训练的。我们假设这种表现的部分原因在于认识到某些任务比其他任务更难,而不是检测特定的运行是否正在走向失败。这种区别很重要,因为任务级难度支持关于在哪里分配计算的决策,而需要运行级预测来决定是否干预正在进行的轨迹。我们通过相同的智能体重复尝试相同的任务来研究基准,并通过相同模型任务单元的成功运行和失败运行之间的比较来进行单独的跨单元比较。在评估的语料库中,超过 99.93% 的汇总 AUROC 基础的正负对是跨单位的。因此,从不观察当前运行的预测器可以实现较高的池化性能,包括 AUROC 高达 0.945 的难度预言机,同时在任务内保持处于随机水平。早期运行级别区分能力在轨迹预测器、已发布监视器和隐藏状态探针中始终较弱,尽管它在执行后期有所改善,并且对于较弱的智能体而言更强。在固定的token预算下,任务级分配优于仅中止策略,而只有当任务内 AUROC 达到约 0.84-0.93(远高于早期监视器观察到的 0.50-0.55 范围)时,早期停止才变得有益。这些结果表明,故障预测不仅应该通过结果准确性来评估,还应该通过捕获的信号是否支持预期的部署决策来评估。