论文

KnowU-Bench:迈向交互式、主动式与个性化的移动智能体评估

KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation

智能体系统上下文与知识记忆Agent任务评测Agent记忆

摘要

能够推断用户偏好并校准主动式辅助的个性化移动智能体,作为日常数字助手前景广阔,但现有基准未能刻画这背后的要求。已有工作评估的是从静态历史恢复偏好,或从固定上下文预测意图;两者均未测试智能体能否通过交互引出缺失的偏好,也未测试它能否在实时GUI环境中决定何时介入、何时征求同意、何时保持沉默。我们提出KnowU-Bench,一个建立在可复现Android仿真环境之上的个性化移动智能体在线基准,涵盖42个通用GUI任务、86个个性化任务和64个主动式任务。与把用户偏好当作静态上下文的已有工作不同,KnowU-Bench对智能体隐藏用户画像,仅暴露行为日志,迫使其实施真正的偏好推断而非上下文查询。为支持多轮偏好引出,它实例化了一个以结构化画像为基础的LLM驱动用户模拟器,实现逼真的澄清对话与主动式同意处理。在个性化之外,KnowU-Bench对完整的主动决策链提供全面评估,包括有据可依的GUI执行、同意协商与被拒后的克制,评估采用规则校验与LLM-as-a-Judge打分相结合的混合协议。我们的实验揭示出显著的性能退化:擅长显式任务执行的智能体,在需要推断用户偏好或校准介入时机的模糊指令下得分跌破50%,即便Claude Sonnet 4.6等前沿模型也不例外。核心瓶颈不在GUI导航,而在偏好获取与介入校准,暴露出娴熟的界面操作与可信的个人辅助之间的根本差距。

KnowU-Bench:迈向交互式、主动式与个性化的移动智能体评估:论文配图
图 2:KnowU-Bench 框架概述。该基准测试结合了可重现的环境模块、GUI 代理、基于用户配置文件和日志的在线用户模拟器,以及将基于规则的检查与LLM作为法官评分相结合的混合评估管道。