论文

通过多角色编排迈向可扩展的轻量GUI智能体

Towards Scalable Lightweight GUI Agents via Multi-role Orchestration

模型优化小模型/轻量模型

摘要

由多模态大语言模型(MLLM)驱动的自主图形用户界面(GUI)智能体可在终端用户设备上实现数字化自动化。尽管同时扩展参数与数据已带来可观收益,先进方法在资源受限设备上的部署成本仍高得令人却步。面对复杂的真实场景,轻量GUI智能体受限于容量不足以及端到端回合式学习下糟糕的任务可扩展性,难以适配多智能体系统(MAS),而训练多个技能专属专家依旧成本高昂。我们能否在这一成本-可扩展性困境中取得有效折中,让轻量MLLM得以参与真实的GUI工作流?为应对这些挑战,我们提出LAMO框架,赋予轻量MLLM以GUI专属知识和任务可扩展性,通过多角色编排扩展其GUI自动化的能力边界。LAMO将面向角色的数据合成与两阶段训练方案相结合:(i)采用困惑度加权交叉熵优化的监督微调,用于知识蒸馏与视觉感知增强;(ii)面向角色协作探索的强化学习。基于LAMO,我们开发了任务可扩展的原生GUI智能体LAMO-3B,同时支持单体执行与MAS式编排。作为即插即用的策略执行器与先进规划器搭配时,LAMO-3B能够持续从规划器的进步中获益,实现更高的性能上限。大量静态与在线评估验证了设计的有效性。

通过多角色编排迈向可扩展的轻量GUI智能体:论文配图
图 1:轻量级代理多角色编排 (LAMO) 框架概述。 LAMO 将面向角色的数据合成与两轮训练方案相结合,以增强屏幕感知、长视野推理和多角色编排。它支持多种推理模式,允许轻量级 MLLM 充当端到端整体代理、协调的 MAS 或与高级规划器配对的即插即用执行器。这种可扩展性通过 MAS 适配扩展了 GUI 自动化中轻量级 MLLM 的能力边界。