论文

当证据稀疏时:对话和 LLM-Agent 轨迹中的弱监督早期故障警报

When Evidence is Sparse: Weakly Supervised Early Failure Alerting in Dialogs and LLM-Agent Trajectories

模型推理推理验证与自校正

摘要

早期故障警报需要在对话或代理轨迹仍在展开时决定是否将其标记为可能失败。这是具有挑战性的,因为监督通常只能作为轨迹级成功/失败标签,而必须从部分交互中发出警报。先前的早期分类方法通常通过为每个前缀分配终端标签,将每个转弯视为失败证据来弥补这一差距。我们假设这种前缀标签假设与多轮语言交互不太匹配,其中最终失败的证据很少并且经常延迟。在本文中,我们介绍了一种两阶段方法,该方法从这种稀疏证据结构中学习,并使用由此产生的风险估计来实现可控的早期警报。具体来说,我们基于注意力的故障预测器从轨迹标签中学习稀疏的转弯级故障证据,并用它来估计部分历史记录中的故障风险。然后,我们将该预测器与 $α$-STOP 配对,这是一种单一偏好条件的停止策略,该策略在推理时选择准确性-早期操作点,而不是为每个偏好训练单独的触发器。在涵盖客户支持、面向任务的对话、说服、工具使用和规划的五个基准中,我们首先表明,高相关性故障证据仅占转弯的 4.7-11.3%,并且平均在 59.0-83.6% 的轨迹之后首次出现。我们进一步表明,与朴素前缀监督相比,基于注意力的预测器将帕累托前沿质量(超容量)提高了 1-10%,并且整个系统比最先进的触发策略将前沿质量提高了 3-42%,同时将每个操作点的训练成本降低了 1-3 个数量级。