论文

UserToolBench:工具使用中个性化决策的用户配置文件隐藏基准 LLM

UserToolBench: A User-Profile-Hidden Benchmark for Personalized Decision Making in Tool-Use LLMs

智能体系统Agent任务评测

摘要

工具使用 LLM 越来越多地被要求代表用户采取行动,但现有基准通常侧重于个人资料回忆、风格模仿、通用工具使用或响应级别个性化。我们推出 UserToolBench,这是工具使用中个性化决策的基准 LLM。 UserToolBench 测试模型是否可以从交互历史记录中推断潜在的用户偏好,识别何时需要澄清,并在不完整信息下生成与用户对齐的工具调用轨迹。该基准测试是根据经过隐私保护的真实交互痕迹构建的,并结合了结构化的角色配置文件、公共 API 式工具生态系统和长期多轮轨迹。它包括 10 个用户配置文件、36 个工具集、1,065 个回合、170 个独特工具以及以评估为中心的任务类型,涵盖信息缺乏、单一工具和多工具设置。强大工具使用LLM的实验表明,当前模型在个性化委托方面仍然存在困难。多工具协调、缺失约束推理和长期行为一致性仍然是主要瓶颈。这些结果表明,个性化评估不应仅询问输出是否针对特定用户,而应询问 LLM 是否为其代表的用户做出正确的决策。