论文

AWARE-US:工具调用代理中偏好感知解析的基准

AWARE-US: Benchmark for Preference-Aware Resolution in Tool-Calling Agents

智能体系统Agent 工具调用

摘要

查询结构化数据库的工具调用会话代理通常面临两个相关的失败:指定不足(缺少运行精确查询所需的约束)和不可行性(完全指定的查询返回空集,因为没有项满足所有约束)。现有的工作通常会“没有结果”,或者使用临时规则放松约束,这可能会通过放弃用户最关心的需求来违反用户意图。我们将不可行性处理构建为偏好感知的查询修复问题:当查询不可满足时,代理应该放宽对用户最不重要的约束。我们提出了三种基于 LLM 的方法来从对话中推断相对约束重要性:(1)局部加权,(2)全局一次性加权,以及(3)成对排名。实验表明,局部加权实现了最佳的偏好对齐,而全局加权在正确的约束放松方面表现最佳。我们还引入了 AWARE-US,这是一个基于角色的查询基准,要求代理通过对话消除请求的歧义,并以符合角色隐含偏好的方式解决不可行性问题。