论文
MintAct:数字环境的统一视觉代理
MintAct: A Unified Visual Agent for Digital Environments
摘要
我们推出了 MintAct,这是一系列视觉语言模型,它统一了 UI 基础、跨移动设备、桌面和 Web 的多步骤导航以及视觉工具的使用,并在 2B、4B 和 8B 尺度上进行了训练。通过仔细设计我们的环境、数据和训练方案,MintAct 模型在所有这些功能上都与每个领域专家的表现相匹配。为此,我们开发了一个可扩展的环境和强化学习 (RL) 基础设施。在环境方面,我们在异构的每个域后端托管数百个并发实例,为轨迹数据收集和在线强化学习提供服务。为了实现高效且可扩展的强化学习训练,异步框架对跨域训练分布保持明确的控制,并在噪声环境反馈和偏离策略漂移的情况下保持稳定。实验结果表明,MintAct 在可比模型大小的各种基准测试中实现了最先进的性能(OSWorld 验证为 48.9)。