论文

Iron:用于增强通才虚拟代理的意图一致和回顾性双重学习框架

Iron: Intent-Aligned and Retrospective Dual Learning Framework for Enhancing Generalist Virtual Agents

模型训练强化学习

摘要

实现能够跨不同数字环境自动执行任务的虚拟代理仍然是嵌入式人工智能的关键挑战。虽然多模态 大语言模型 (MLLM) 提供增强的视觉感知和推理,但其代理部署面临三个挑战:昂贵的数据注释、不精确的动作意图对齐以及从废弃的失败轨迹中进行低效探索。为了解决这些问题,我们引入了 Iron,这是一个意图一致、自我改进且注释高效的框架,用于训练 GUI智能体。 Iron 采用了一种新颖的双重学习策略,利用逐步循环一致 (SCC) 奖励来实现底层动作和高级意图之间的细粒度对齐,从而改善指令基础和意图理解。同时,Iron 引入了事后重现机制,将失败的轨迹重新用于训练,从而提高学习效率和任务多样性。大量实验表明,经过 Iron 训练的多面手智能体持续提高跨环境和跨设备任务的性能,优于使用三倍数据训练的模型。 Iron 还在未见过的 Web 任务上实现了 25.06% 的相对改进,并且在固有复杂的任务上观察到了进一步的改进,证明了构建更强大的虚拟代理的可行性。