论文

LLM智能体澄清请求的不确定性分解

Uncertainty Decomposition for Clarification Seeking in LLM Agents

智能体系统Agent 规划

摘要

近期的立场论文主张经典的偶然/认识不确定性框架不足以支撑交互式大语言模型(LLM)智能体——并呼吁欠指定感知、可分解、可传达的不确定性表示——以解锁主动澄清请求与共享心智模型构建等新能力。实际部署约束——黑盒API、交互延迟预算与无标注轨迹——排除了基于logprob、多次采样与训练的方法——使基于提示的估计成为部署时浮现此类信号的最可行家族。我们以一个简单的基于提示的分解回应这一呼吁:把动作置信与请求不确定性(u)分离——使智能体在任务规格含糊时请求澄清。为评估——我们引入两个澄清增广基准(WebShop-Clarification与ALFWorld-Clarification)——其中50%任务被刻意欠指定——并系统比较所提分解与ReAct+UE及不确定性感知记忆(UAM)跨五个LLM骨干(GPT-5.1、DeepSeek-v3.2-exp、GLM-4.7、Qwen3.5-35B、GPT-OSS-120B)在这些变体及标准WebShop、ALFWorld与REAL故障检测基准上的表现。跨五骨干平均——所提分解把ALFWorld-Clarification上的澄清F1较ReAct+UE提升73%、较UAM提升36%——并在WebShop-Clarification的全部骨干与ALFWorld-Clarification的五分之四骨干上领先澄清F1——表明增益泛化超出单一LLM。

LLM智能体澄清请求的不确定性分解:论文配图
图 1:步骤 tt 中提出的方法。 LLM 模块 π\pi(蓝色)在一次前向传递中消耗目标 gg、当前观察 oto_{t} 和历史 HtH_{t},并发出两个不确定性信号:请求不确定性 utu_{t} 和解释 xtx_{t}(橙色),以及行动置信度 ctc_{t} 和解释 ete_{t} 以及推理 rtr_{t} 和建议的行动 ata_{t}(绿色)。确定性路由测试 ut≥θu_{t}\geq\theta 在 request_clarification 和 ata_{t} 执行之间切换。所有发出的字段都会附加到后续步骤的历史记录中。在发出 ata_{t} 之前评估 utu_{t} 可确保在采取任何行动之前捕获不规范的情况,从而为代理提供单一置信度分数无法提供的目标模糊性的专用通道。