论文

具有信息增益的LLM智能体不确定性感知澄清

Uncertainty-Aware Clarification in LLM Agents with Information Gain

模型训练强化学习

摘要

大型语言模型 (LLM) 代理通常在未指定的用户指令下运行,其中用户意图的潜在不确定性会导致错误的工具操作。为了应对这一挑战,我们提出了一个以目标为导向的澄清框架,将澄清行为与歧义解决相结合。我们方法的核心是信息增益奖励,这是一种通过测量由澄清交换引起的基本事实目标的贝叶斯信念更新来量化澄清问题的效用的指标。我们使用此奖励来训练澄清者(LLM),以优化高信息增益,确保澄清有效减少不确定性并提高代理-工具-用户环境中的任务完成情况。我们在澄清增强的 $τ$-Bench 环境中验证我们的框架,跨五个异构骨干网进行跨代理评估。经验结果表明,我们的方法比无澄清基线持续提高了 3.7% 的成功率,同时平均只增加了 0.3 个总交互步骤。

具有信息增益的LLM智能体不确定性感知澄清:论文配图
图 1:τ\tau 零售轨迹的澄清示例。当初始工具调用由于信息缺失或未指定而失败时,澄清者会提出有针对性的后续问题(突出显示),以从用户那里引出所需的约束。通过此交换提供的附加信息允许代理继续进行更正的工具调用并完成任务。