论文

辅助Agent通过信息价值推理进行理性澄清

Rational Clarification by Assistive Agents via Value-of-Information Reasoning

智能体系统Agent 动作执行与治理

摘要

基于语言的辅助Agent的用户经常提出不明确的请求。作为回应,助理可以直接根据其对请求的解释采取行动——冒着与用户不一致的风险——或者提出一个澄清问题。哪个选项最安全、最有帮助?一种常见的方法是提出问题,最大限度地减少用户意图的不确定性,直到达到阈值。然而,这忽略了不确定性减少对下游性能的影响、询问与立即采取行动的成本,以及用户可能在未被询问的情况下提供更正的可能性。为了应对这些权衡,我们引入了通过信息价值推理进行理性探究(REVOIR)。 REVOIR 通过对问题的信息价值进行推理时间推理来做出澄清决策,从而捕获由于收到的答案而导致的任务奖励的预期改进。在两项辅助任务中——模糊问答 (CondAmbigQA) 和偏好一致的家庭任务规划 (ADAPT)——我们表明,与基于提示、思维链、微调或信息获取的方法相比,REVOIR 用更少的问题取得了更大的成功,与微调的澄清政策相比,ADAPT 的偏好满意度提高了 13-15%,同时无需培训,提出的问题也少了五倍。此外,当助手在行动后可以收到廉价的用户修正时,REVOIR 自然地推断出提问并不总是有效的,这证明了我们方法的适应性。相比之下,我们发现普通推理Agent无法自适应地澄清用户请求,并且随着推理工作量的增加,请求的澄清会更少。