论文
MagicGUI-RMS:经自动反馈回流实现GUI智能体自我进化的多智能体奖励模型系统
MagicGUI-RMS: A Multi-Agent Reward Model System for Self-Evolving GUI Agents via Automated Feedback Reflux
摘要
图形用户界面(GUI)智能体正快速迈向跨多样应用的自主交互与可靠任务执行。然而,两大核心挑战仍未解决:自动化评估智能体轨迹,以及大规模生成高质量训练数据以支持持续改进。现有方法往往依赖人工标注或静态的基于规则的验证,限制了可扩展性并削弱在动态环境中的适应性。我们提出 MagicGUI-RMS,一个提供自适应轨迹评估、纠正性反馈与自进化学习能力的多智能体奖励模型系统。MagicGUI-RMS 把领域特定奖励模型(DS-RM)与通用奖励模型(GP-RM)结合,实现细粒度动作评估以及在异构 GUI 任务间的稳健泛化。为支持大规模奖励学习,我们设计了结构化数据构建管线,自动产出均衡且多样的奖励数据集,在保持样本保真度的同时有效降低标注成本。执行期间,奖励模型系统识别错误动作、提出改进替代方案,并通过自动数据回流机制持续增强智能体行为。大量实验表明,MagicGUI-RMS 在任务准确率与行为鲁棒性上带来可观收益。这些结果把 MagicGUI-RMS 确立为构建由奖励驱动适配的自我改进 GUI 智能体的有原则且有效的基础。
