论文

APeB:大语言模型智能体个性化能力基准

APeB: Benchmarking Personalization Ability of Large Language Model Agents

智能体系统Agent任务评测

摘要

LLM驱动的智能体在用户发出原始、欠指定查询时难以个性化。在此设定下——智能体必须推断潜在意图、从噪声交互历史中提取偏好、并在竞争备选间做出选择。既有基准很少测试该能力——因为它们常依赖用户精炼的查询或简化历史。我们引入个性化产品搜索(PPS)——原始查询与多样历史下智能体个性化的试验台。我们从动作日志构建智能体个性化基准(APeB)——将欠指定意图与丰富历史及用户浏览过的候选项配对。以多步智能体工作流评估最先进LLM——我们发现模型处理显式查询良好——但在需要意图与偏好发现的早期阶段查询上挣扎。量规分析将该差距主要归因于无效的历史使用。简单的历史感知查询精化管线VQRA产生一致增益——凸显个性化智能体需要专门的历史利用模块。

APeB:大语言模型智能体个性化能力基准:论文配图
图 1:代理面临的个性化挑战:从不同的历史中推断意图和偏好,以做出符合偏好的决策。