论文

AgentForesight:多代理系统中早期故障预测的在线审计

AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems

智能体系统Agent 动作执行与治理

摘要

基于 LLM 的多智能体系统越来越多地部署在长期任务上,但单个决定性错误通常会被下游智能体接受,并级联成轨迹级故障。现有的工作将其框架为 \emph{事后故障归因},诊断负责的代理并在轨迹结束后采取步骤。然而,当轨迹仍在展开时,这种范式就失去了任何干预的机会。在这项工作中,我们引入了 AgentForesight,一个将这个问题重新定义为在线审核的框架:在展开轨迹的每一步,审核员仅观察当前前缀,并且必须继续运行或在最早的决定性错误时发出警报,而无法访问未来的步骤。为此,我们策划了 AFTraj-2K,这是一个跨编码、数学和代理领域的代理轨迹语料库,其中安全轨迹在严格的管理流程下保留,不安全轨迹通过多个 LLM 法官的共识在其决定性错误的步骤中进行注释。在此基础上,我们开发了 AgentForesight-7B,这是一种采用从粗到细的强化学习方法进行训练的紧凑型在线审计员,首先在相邻安全/不安全前缀对的故障边界处配备风险预期,然后在三轴奖励下将其锐化为精确的步骤级定位,共同针对审计判决的内容、地点和人员。在 AFTraj-2K 和外部 Who\&When 基准测试中,AgentForesight-7B 的性能优于领先的专有模型,包括 GPT-4.1 和 DeepSeek-V4-Pro,实现了高达 +19.9% 的性能增益和 步骤定位误差降至约三分之一,打开了从事后故障检测到实现部署时干预的循环。项目页面:https://zbox1005.github.io/agent-foresight/