论文

TRACER:面向Agentic推理中关键片段的轨迹风险聚合

TRACER: Trajectory Risk Aggregation for Critical Episodes in Agentic Reasoning

模型评测评测方法与指标

摘要

在人与AI Agent真实的多轮工具使用交互中估计不确定性之所以困难,是因为失败往往由稀疏的关键片段(critical episode,例如循环、不连贯的工具使用或用户-Agent协调失当)触发,即便局部生成看似自信。现有不确定性代理指标聚焦于单轮文本生成,因而遗漏这些轨迹层面的崩溃信号。我们提出TRACER,一个面向双控制(dual-control)工具-Agent-用户交互的轨迹级不确定性度量。TRACER将内容感知的惊奇度(surprisal)与情境感知信号、语义与词面重复以及基于工具的连贯性缺口相结合,并以带MAX复合步风险的尾部聚焦风险泛函加以聚合,以浮现决定性的异常。我们在τ²-bench上通过预测任务失败与选择性任务执行来评估TRACER。由此,TRACER相较基线将AUROC最多提升37.1%、AUARC最多提升55%,能够在复杂的对话式工具使用场景中更早、更准确地检测不确定性。我们的代码与基准见https://github.com/sinatayebati/agent-tracer。

TRACER:面向Agentic推理中关键片段的轨迹风险聚合
图1:用于智能体推理(agentic reasoning)中轨迹级不确定性估计的 TRACER 概览。左:包含工具调用与延迟失败处理的多轮智能体—用户交互。右:在智能体的每一步 t t ,计算内容感知惊异度(content-aware surprisal)U t U_{t} 、智能体重复度 D a ​ ( t ) D_{a}(t) 、动作—观测失配 D o A ​ ( t ) D_{o}^{A}(t) 以及用户—智能体协调差距 D o U ​ ( t ) D_{o}^{U}(t) ,并通过 MAX 组合的步级风险将其合并,即 r t = max ⁡ ( U t , α ​ D a ​ ( t ) , β ​ D o A ​ ( t ) , γ ​ D o U ​ ( t ) ) r_{t}=\max(U_{t},\alpha D_{a}(t),\beta D_{o}^{A}(t),\gamma D_{o}^{U}(t)) 。轨迹风险通过聚焦尾部的聚合(top- K K 均值与 ℓ ∞ \ell_{\infty} 范数)得到。