论文
CRG:Agent 轨迹的结构化置信推断
Confidence Reasoning Graphs: Structured Confidence Estimation for LLM Agents
摘要
当在结果域中使用 LLM 智能体时,要就是否信任其输出或进行干预做出明智的决定,需要对智能体的成功有校准的信心。 智能体的置信度估计很困难,因为有关成功的证据分布在智能体轨迹的异构、相互依赖的步骤中。实际的 Agentic 部署带来了进一步的挑战:前沿 LLM 通常提供对内部信号的有限访问,智能体的部署成本高昂,并且训练数据可能不可用或很快就会过时。为了应对这些挑战,我们引入了置信推理图 (CRG),这是一种推理时框架,可估计智能体从单个轨迹完成其任务的概率,无需特权模型访问或训练数据。 CRG 不是将执行压缩为单个整体判断,而是从智能体完成其任务的声明开始,将其分解为基于轨迹证据的上下文子声明,估计每个最终声明的置信度,最后将它们汇总为总体置信估计。在三个 Agentic 基准、三个 骨干模型 模型和三个智能体框架中,CRG 比口头的、基于采样的白盒 代理模型 基线产生了更好的校准信心和更强的风险意识决策。我们进一步发现,单独的校准误差可能会产生误导:白盒 代理模型 基线看起来校准良好,同时提供近 随机水平 区分能力。 消融 将 CRG 的改进归因于声明级置信度估计和聚合,而不仅仅是图形构建。最后,CRG 公开每个置信估计背后的主张和轨迹证据,使其能够在决策时进行审核。
