论文
从序列到结构:LLM 代理的关系不确定性传播
From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents
摘要
可靠的不确定性量化 (UQ) 对于在复杂的交互环境中部署 大语言模型 (LLM) 代理至关重要。现有的 UQ 方法在很大程度上依赖于局部信号,例如标记概率、预测熵或每步置信度,因此忽略了错误在执行轨迹上累积的长期依赖性。因此,他们可能无法识别代理故障,这些故障的原因源于最终答案之前的几个推理或交互步骤。我们提出了 RUPA(代理的关系不确定性传播),这是 LLM 代理的轨迹级 UQ 框架。 RUPA 将执行历史表示为有向轨迹图,其中推理状态、工具交互和环境反馈是由时间和语义依赖边连接的节点。然后,它在该图上传播不确定性,以捕获执行风险如何累积并在交互步骤之间转移。传播的信号与轨迹级行为特征和目标对准信息相结合,生成完整代理轨迹的置信度估计。我们使用跨越多个模型系列的 6 个开源 LLM 在代表性代理基准上评估 RUPA,包括 $τ$-2、Terminal-Bench-2 和 GAIA。实验结果表明,RUPA 通过提供更准确的不确定性估计、实现更早的故障检测以及改进跨不同代理任务的不确定性引导代理执行,始终优于现有的 UQ 方法。这些结果表明,显式建模关系依赖性对于长期 LLM 代理的可靠 UQ 至关重要,为可信代理执行提供了实用基础。