论文
先感知再推理:高效移动智能体的预推理感知框架
Perceive Before Reasoning: A Pre-Reasoning Perception Framework for Efficient and Reliable Proactive Mobile Agents
摘要
多模态大语言模型(MLLM)具有相当先进的移动代理,但主动移动协助仍然具有挑战性,因为代理必须在确定如何提供协助之前决定何时进行干预。现有系统通常在基于 MLLM 的统一管道中实施这两个决策,从而导致保守干预过滤和综合援助生成之间的目标不一致,以及代理应保持沉默时的冗余推理。为了解决这些限制,我们提出了预推理感知框架(PRPF),这是一个建立在推理之前感知的两阶段框架。 PRPF 引入了用于干预门控和上下文压缩的轻量级多模态主动感知器 (MPP),并且仅在需要干预时才激活主动代理推理器 (PAR)。 ProactiveMobile 基准上的实验表明,与 ProactiveMobile 基准相比,PRPF 大幅降低了错误触发率 (FTR),同时提高了成功率 (SR) 和推理效率。
