论文
具有信息增益的LLM智能体不确定性感知澄清
Uncertainty-Aware Clarification in LLM Agents with Information Gain
摘要
大型语言模型 (LLM) 代理通常在未指定的用户指令下运行,其中用户意图的潜在不确定性会导致错误的工具操作。为了应对这一挑战,我们提出了一个以目标为导向的澄清框架,将澄清行为与歧义解决相结合。我们方法的核心是信息增益奖励,这是一种通过测量由澄清交换引起的基本事实目标的贝叶斯信念更新来量化澄清问题的效用的指标。我们使用此奖励来训练澄清者(LLM),以优化高信息增益,确保澄清有效减少不确定性并提高代理-工具-用户环境中的任务完成情况。我们在澄清增强的 $τ$-Bench 环境中验证我们的框架,跨五个异构骨干网进行跨代理评估。经验结果表明,我们的方法比无澄清基线持续提高了 3.7% 的成功率,同时平均只增加了 0.3 个总交互步骤。
