GUI-HARVEST:通过证据驱动的框架进化自我改进 GUI Agent
GUI-HARVEST: Self-Improving GUI Agents through Evidence-Driven Harness Evolution
摘要
GUI 模型周围的可执行工具决定如何组装观察结果、执行操作以及控制验证、恢复和终止。与非 GUI Agent的Harness优化相比,自动优化该Harness带来了三个相互关联的挑战:协调模型意图与观察到的视觉效果、诊断可变执行结果下的故障以及识别跨任务的重复故障模式并将其转换为可重用的运行时更改。我们推出了 GUI-HARVEST,这是一种自动Harness优化器,可以通过冻结主干模型来自我改进 GUI Agent。首先,为了对观察到的动作效果进行基础诊断,它将模型输出和执行的动作与前后屏幕截图对齐,将发现结果与特定的界面转换联系起来。其次,为了解释执行的可变性,它将同一任务的重复运行视为联合证据单元,使用任务内比较来定位与结果相关的行为差异。第三,它将跨任务的验证结果整合到重复的失败模式中,将它们映射到有限的源代码编辑以及评估之前记录的预测,并通过重复执行检查预测的行为效果和任务性能。 OSWorld-Verified 上的实验表明,六种通用开放、GUI 专用开放和专有骨干模型具有一致的增益; Qwen3-VL-32B-Instruct 在全套套件上获得了 12.33 分。 Frozen-harness 传输在 WindowsAgentArena 上以 50 个步骤将 GPT-5 提高了 13.87 个百分点,而无需进一步优化。凭借相同的主干和初始工具,GUI-HARVEST 的性能优于 Self-Harness 和 Meta-Harness,这表明 GUI 特定的诊断和验证有助于将工具改进推广到看不见的任务。该代码可在 https://github.com/GaryYang12345/GUI-HARVEST. 获取