论文
Agentic置信度校准
Agentic Confidence Calibration
摘要
AI 智能体正迅速从被动的语言模型演进为执行复杂多步任务的自主系统。然而,它们对失败的过度自信仍是高风险场景部署的根本障碍。现有校准方法为静态单轮输出而建,无法应对智能体系统的独特挑战,例如沿轨迹的复合误差、来自外部工具的不确定性以及不透明的失败模式。为应对这些挑战,我们首次提出 Agentic 置信度校准问题,并提出整体轨迹校准(HTC),一个新颖的诊断框架,它从宏观动态到微观稳定性,跨智能体整个轨迹提取丰富的过程级特征。凭借一个简单可解释的模型,HTC 在八个基准、多个 LLM 与多样智能体框架上一致超越强基线的校准与判别能力。除性能外,HTC 带来三项关键进展:通过揭示失败背后的信号提供可解释性;通过跨领域免重训应用实现可迁移性;并通过通用智能体校准器(GAC)实现泛化——该校准器在域外 GAIA 基准上取得最佳校准(最低 ECE)。这些贡献共同确立了以过程为中心的置信度校准新范式,为诊断与增强 AI 智能体可靠性提供框架。
