论文
Agentic不确定性量化
Agentic Uncertainty Quantification
摘要
尽管 AI 智能体在长程推理中展现出令人印象深刻的能力,其可靠性严重受制于幻觉螺旋——早期认识错误不可逆地传播。现有方法面临两难:不确定性量化(UQ)方法通常充当被动传感器,只诊断风险而不处理;而自我反思机制则遭受持续或漫无目的的纠正。为弥合这一差距,我们提出统一的双过程 Agentic UQ(AUQ)框架,把言语化的不确定性转化为主动的双向控制信号。我们的架构包含两个互补机制:系统 1(不确定性感知记忆 UAM),隐式传播言语化置信度与语义解释以防止盲目的决策;系统 2(不确定性感知反思 UAR),把这些解释作为理性线索,只在必要时触发有针对性的推理时消解。这使智能体得以在高效执行与深度深思之间动态平衡。在闭环基准与开放式深度研究任务上的大量实验表明,我们的免训练方法取得更优性能与轨迹级校准。我们相信这一有原则的 AUQ 框架代表了迈向可靠智能体的重要一步。
