论文
ProactiveMobile:评测移动智能体的主动意图推断与行动
ProactiveMobile: A Comprehensive Benchmark for Boosting Proactive Intelligence on Mobile Devices
摘要
多模态大语言模型(MLLM)在移动智能体开发方面取得显著进展,但其能力主要局限于被动式范式,即仅执行用户的显式指令。主动智能这一新兴范式要求智能体自主预判需求并主动发起动作,是移动智能体的下一个前沿。然而,其发展严重受制于基准的缺乏——既能应对真实世界复杂性、又能支持客观可执行评估的基准。为克服这些挑战,我们提出 ProactiveMobile,一个旨在系统性推进该领域研究的全面基准。ProactiveMobile 将主动任务形式化为:从设备端上下文信号的四个维度推断潜在用户意图,并从包含 63 个 API 的综合函数池生成可执行函数序列。该基准包含 14 个场景的 3,660 多个实例,通过多答案标注纳入真实世界复杂性。为确保质量,一个 30 人专家团队对基准进行了最终审计,核验事实准确性、逻辑一致性与动作可行性,并修正所有不合规条目。大量实验表明,我们微调的 Qwen2.5-VL-7B-Instruct 达到 19.15% 的成功率,优于 o1(15.71%)与 GPT-5(7.39%)。这一结果表明,主动性是当前 MLLM 普遍缺乏但可学习的关键能力,凸显了所提基准对主动性评估的重要性。
