论文

GRUET:量化智能体推理与行动过程的不确定性

GRUET: Quantifying Uncertainty of Agentic Reasoning-and-Acting Processes

智能体系统Agent任务评测

摘要

智能体因能够在开放、动态的环境中同时执行推理与行动(ReAct)而受到越来越多的关注。ReAct 过程通常表现为多轮轨迹:大语言模型(LLM)在其中以交错方式生成推理链与任务相关动作。然而,智能体常常面临显著的不确定性——相同的任务会产生不同的轨迹;不确定性较高的轨迹往往出现难以理解的行为,严重损害智能体的可信度。本工作推测,这类轨迹级不确定性往往源于 LLM 引起的轮级推理不确定性的累积;后者常表现为发散的推理分支及其所致动作的集合。基于此,我们提出 GRUET(Graph-based Reasoning UncErtainty in Trajectories)方法,对 ReAct 进行不确定性量化,包含轮级推理不确定性量化与轨迹级不确定性聚合两部分:前者将潜在推理分支张成的推理空间建模为图,并以图复杂度近似推理空间复杂度,从而精确量化推理不确定性;后者采用简单的聚合策略量化整条轨迹的可信度。在九个 LLM 与五个基准上的实证评估表明,以 AUROC、AUPRC 和 AUARC 衡量的选择性生成性能验证了 GRUET 的有效性。

GRUET:量化智能体推理与行动过程的不确定性:论文配图
图 1:我们提出的 GRUET 的工作流。