论文
LLM智能体澄清请求的不确定性分解
Uncertainty Decomposition for Clarification Seeking in LLM Agents
摘要
近期的立场论文主张经典的偶然/认识不确定性框架不足以支撑交互式大语言模型(LLM)智能体——并呼吁欠指定感知、可分解、可传达的不确定性表示——以解锁主动澄清请求与共享心智模型构建等新能力。实际部署约束——黑盒API、交互延迟预算与无标注轨迹——排除了基于logprob、多次采样与训练的方法——使基于提示的估计成为部署时浮现此类信号的最可行家族。我们以一个简单的基于提示的分解回应这一呼吁:把动作置信与请求不确定性(u)分离——使智能体在任务规格含糊时请求澄清。为评估——我们引入两个澄清增广基准(WebShop-Clarification与ALFWorld-Clarification)——其中50%任务被刻意欠指定——并系统比较所提分解与ReAct+UE及不确定性感知记忆(UAM)跨五个LLM骨干(GPT-5.1、DeepSeek-v3.2-exp、GLM-4.7、Qwen3.5-35B、GPT-OSS-120B)在这些变体及标准WebShop、ALFWorld与REAL故障检测基准上的表现。跨五骨干平均——所提分解把ALFWorld-Clarification上的澄清F1较ReAct+UE提升73%、较UAM提升36%——并在WebShop-Clarification的全部骨干与ALFWorld-Clarification的五分之四骨干上领先澄清F1——表明增益泛化超出单一LLM。
