论文

PrefixGuard:从LLM智能体轨迹到在线失败预警监视器

PrefixGuard: From LLM-Agent Traces to Online Failure-Warning Monitors

智能体系统Agent 动作执行与治理

摘要

大语言模型 (LLM) 代理现在执行耗时的、使用工具的任务,其中最终结果检查可能来得太晚而无法进行干预。在线警告需要对异构跟踪进行轻量级前缀监视器,但手工编写的事件模式很脆弱,并且部署时 LLM 判断成本高昂。我们引入了 PrefixGuard,这是一个跟踪到监视器的框架,具有离线 StepView 归纳步骤,然后是监督监视器训练。 StepView 从原始跟踪样本中引入确定性的类型步骤适配器,监视器从最终结果中学习事件抽象和前缀风险评分器。在 WebArena、$τ^2$-Bench、SkillsBench 和 TerminalBench 中,最强的 PrefixGuard 监视器达到 0.900/0.710/0.533/0.557 AUPRC。使用每种表示中最强大的后端,它们比原始文本控件平均提高了 +0.137 AUPRC。在相同的前缀警告协议下,LLM法官仍然处于弱势。我们还得出了精确召回曲线(AUPRC)下基于分数的面积的可观察性上限,该上限将监控错误与在观察到的前缀中缺乏证据的故障分开。对于有限状态审计,事后确定性有限自动机 (DFA) 提取在 WebArena 和 $τ^2$-Bench(29 和 20 个状态)上保持紧凑,但在 SkillsBench 和 TerminalBench 上扩展到 151 和 187 个状态。最后,第一警报诊断表明,强大的排名并不意味着部署实用性:WebArena 排名良好,但无法支持低误报警报,而 $τ^2$-Bench 和 TerminalBench 保留了更多可操作的早期警报。总之,这些结果使 PrefixGuard 成为一种实用的监控合成方法,可以在前缀警告转化为可行的干预措施时进行明确的诊断。

PrefixGuard:从LLM智能体轨迹到在线失败预警监视器:论文配图
图 1:PrefixGuard 管道。 StepView 将原始步骤转换为键入的字段。术语频率-逆文档频率(TF-IDF)编码和事件抽象产生学习符号,并且监控分数在线前缀风险。硬符号可以编译到 PrefixGuard-DFA 中以评估紧凑的有限状态审计。