论文
从失败中学习:计算机使用代理的推理时间自我改进
Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents
摘要
计算机使用代理利用多模式 大语言模型 (MLLM) 来操作计算机并完成任务,因其实用性和多功能性而引起了广泛关注。开发这些智能体的一个主要挑战是收集大规模、高质量的轨迹。标准方法通过自我改进循环生成合成数据:将代理放置在可验证的环境中,并对其成功轨迹进行迭代微调。尽管它很有效,但这种范式仅利用成功的轨迹并丢弃失败的轨迹,即使失败携带了有关模型弱点的丰富信息。在这项工作中,我们探索了一个互补的失败驱动的自我改进循环,这是一种以数据为中心的范式,将失败的轨迹转化为代理改进。具体来说,我们采用 LLM 来诊断故障模式,提出推理时间解决方案,并生成代码补丁(由人工轻微验证)以升级代理。我们在 OSWorld 基准上使用最先进的 OpenCUA-72B 模型验证了这种方法,将成功率从 42.3% 提高到 48.9%,提高了 6.6 个百分点,无需任何额外的训练成本,并且只有适度的推理开销。我们的结果表明,失败驱动的自我改进是对基于成功的管道的可行补充,可以实现更有效的座席改进。