论文

Agent知道自己成功了吗?基于内部表征的置信度校准

Do Agents Know When They Succeed? Calibrating Agent Confidence from Internal Representations

模型评测评测方法与指标

摘要

随着智能体系统在安全关键应用中迅速采用,衡量与智能体操作相关的置信度至关重要。与传统的机器学习系统相比,智能体工作流具有复杂的故障模式,包括规划、工具调用和动态环境交互。在本文中,我们研究了模型的内部表示是否在多轮智能体设置中提供了最终任务成功的更强信号。我们引入了两种互补的方法:潜在轨迹动力学(LTD),它总结了整个交互轨迹中残差流表示的变化;以及动作表示探测(ARP),它根据动作决策时形成的表示来预测成功。在三个交互式基准(Bash、SQL、Python)和三个模型系列(Qwen14B、Qwen7B、DeepSeek6.7B)中,我们的方法始终优于表面水平生成和基于序列的校准基线,提供零开销可靠性监视器,既不需要立即更改,也不需要多样本部署。