论文
面向高效计算机操作智能体的步骤级优化
Step-level Optimization for Efficient Computer-use Agents
摘要
计算机操作智能体为通用软件自动化提供了一条有前景的路径,因为它们可以直接与任意图形用户界面交互,而不必依赖脆弱的、针对特定应用的集成。尽管基准性能近来不断进步,强大的计算机操作智能体在实践中仍然昂贵而缓慢,因为大多数系统在几乎每个交互步骤都要调用大型多模态模型。我们认为,这种算力的均匀分配对于长程GUI任务而言从根本上是低效的。这类轨迹高度异质:许多步骤是常规性的,可以由更小、更便宜的策略可靠处理,而错误往往集中在相对少数的高风险时刻。在各类计算机操作基准上,这些失败反复呈现两种形式:一是进展停滞,即智能体陷入循环、重复无效动作或无法取得有意义的进展;二是静默语义漂移,即智能体在已经偏离用户真实目标之后仍继续采取局部看似合理的动作。为解决这种低效,我们提出一种事件驱动、步骤级的计算机操作智能体级联方案:默认运行小型策略,仅当轻量级学习型监控器检测到风险升高时才升级到更强的模型。我们的框架结合两种互补信号:Stuck Monitor从近期的推理-动作历史中检测进展退化并触发恢复;Milestone Monitor识别语义上有意义的检查点,在这些点上进行稀疏验证最有助于发现漂移。这一设计将持续开启的前沿模型推理转变为交互演进过程中自适应、按需的算力分配。该框架模块化且面向部署:它可以叠加在现有计算机操作智能体之上,无需改变底层智能体架构或重新训练大模型。
