论文
PROUR:判断应澄清用户偏好还是验证外部事实
Clarify the User or Verify the World? Uncertainty Routing for Proactive Agents
摘要
使用工具的LLMAgent不仅必须决定是否需要额外的信息,而且还必须决定哪个来源可以解决不确定性。现有的主动方法通常专注于用户澄清或环境验证,而没有明确确定每个决策的适当信息源。我们将这个问题表述为 ACT、CLARIFY 和 VERIFY 之间的不确定性路由,并提出 PROUR,一种主动的不确定性路由框架。 PROUR 将行动不确定性分解为看似合理的用户目标解释之间的分歧,这表明用户方的模糊性,以及每种解释中剩余的熵,这表明世界方证据的缺失。为了从路由源获取信息,查询生成器接受模式条件信息增益奖励的训练,目标是“澄清”下的用户目标识别和“验证”下的下一步操作识别。在 $\tau$ 基准上,PROUR 在零售和航空公司中实现了 28.17% 的平均成功率,比最强的先验方法高 4.57%,同时减少了 2.17 个交互步骤。学习到的策略进一步推广到更强大的任务Agent和 $\tau^3$-bench 的事务域,无需再训练,证明了源对齐不确定性解决方案对于主动Agent的好处。
