论文

反思本地计算机使用智能体的推理时扩展:失败模式与算力权衡

Rethinking Inference-Time Scaling in Local Computer-Use Agents: Failure Modes and Compute Tradeoffs

模型推理测试时计算扩展

摘要

出于隐私、成本效率与实际可用性的考虑,在本地部署自主计算机使用智能体(CUA)正日益重要,但在严格硬件约束下提升其性能仍然具有挑战性。尽管近期研究表明推理时扩展可通过执行期间的额外计算改进前沿计算机使用智能体,但其在资源受限本地模型上的有效性仍鲜有人理解。我们针对本地CUA的推理时扩展,从上下文、时间、结构与并行四个维度开展系统性实证研究。我们在OSWorld基准上评估了Qwen3-VL-8B/30B-A3B、UI-TARS-1.5-7B与OpenCUA-7B。结果显示,额外计算往往收益递减,同时会改变失败模式。上下文扩展提供历史依据,可改善轨迹稳定性与任务准确性,但其收益随token成本上升而饱和,且失败从重复或停滞的轨迹转向过早的虚假成功。时间扩展同样减少了最大步数停滞,却未能显著提升任务成功率,表明更长的时域往往只是延续错误轨迹而非纠正它们。我们进一步发现,结构分解会给本地两阶段智能体引入规划与格式化开销,而并行扩展以高昂的计算代价部分缓解这些失败。总体而言,我们的发现表明,高效的本地CUA需要选择性的算力分配、失败感知的控制机制,以及围绕本地模型能力与局限设计的智能体框架。

反思本地计算机使用智能体的推理时扩展:失败模式与算力权衡:论文配图
图 1:CUA 框架和推理时间缩放维度的图示。 (a) 单个代理直接将当前屏幕截图和历史长度 (HH) 映射到最大时间预算 (SS) 内的操作。 (b) 两阶段代理将此过程解耦为生成多个并行候选计划 (PP) 的规划阶段和执行所选操作的基础阶段。