论文

面向高效计算机操作智能体的步骤级优化

Step-level Optimization for Efficient Computer-use Agents

模型推理智能体系统测试时计算扩展Agent Harness

摘要

计算机操作智能体为通用软件自动化提供了一条有前景的路径,因为它们可以直接与任意图形用户界面交互,而不必依赖脆弱的、针对特定应用的集成。尽管基准性能近来不断进步,强大的计算机操作智能体在实践中仍然昂贵而缓慢,因为大多数系统在几乎每个交互步骤都要调用大型多模态模型。我们认为,这种算力的均匀分配对于长程GUI任务而言从根本上是低效的。这类轨迹高度异质:许多步骤是常规性的,可以由更小、更便宜的策略可靠处理,而错误往往集中在相对少数的高风险时刻。在各类计算机操作基准上,这些失败反复呈现两种形式:一是进展停滞,即智能体陷入循环、重复无效动作或无法取得有意义的进展;二是静默语义漂移,即智能体在已经偏离用户真实目标之后仍继续采取局部看似合理的动作。为解决这种低效,我们提出一种事件驱动、步骤级的计算机操作智能体级联方案:默认运行小型策略,仅当轻量级学习型监控器检测到风险升高时才升级到更强的模型。我们的框架结合两种互补信号:Stuck Monitor从近期的推理-动作历史中检测进展退化并触发恢复;Milestone Monitor识别语义上有意义的检查点,在这些点上进行稀疏验证最有助于发现漂移。这一设计将持续开启的前沿模型推理转变为交互演进过程中自适应、按需的算力分配。该框架模块化且面向部署:它可以叠加在现有计算机操作智能体之上,无需改变底层智能体架构或重新训练大模型。

面向高效计算机操作智能体的步骤级优化:论文配图
图 1:针对计算机使用代理提出的事件驱动、步骤级级联的概述。默认情况下,一个小策略会起作用,同时两个轻量级监视器分析轨迹:当最近的步骤显示重复操作或缺乏进展时,卡住事件检测器会触发升级,而里程碑事件检测器会选择语义上有意义的检查点,通过更强大的模型进行稀疏验证,如果检查通过,则将控制权返回给小策略,否则将控制权交给大策略。