论文

GAIA:用于训练GUI测试时扩展评论家模型的数据飞轮系统

GAIA: A Data Flywheel System for Training GUI Test-Time Scaling Critic Models

模型训练奖励建模与过程监督

摘要

虽然大型视觉语言模型 (LVLM) 在解析文本指令、解释屏幕内容和执行任务方面具有显着先进的 GUI 代理能力,但仍然存在一个关键挑战:代理操作的不可逆性,其中单个错误操作可能会引发灾难性偏差。为了解决这个问题,我们提出了 GUI Action Critic 的数据飞轮系统(GAIA),这是一个训练框架,使模型能够具有迭代批评家功能,用于提高基本 GUI 代理性能的测试时间缩放(TTS)。具体来说,我们首先使用基本代理的积极和消极行动示例来训练直观批评模型(ICM)。该批评家评估智能体预期行动的直接正确性,从而选择具有更高成功概率的操作。然后,初始批评者指导代理行动以收集精炼的正/负样本,启动自我改进循环。然后,增强的数据会训练具有增强辨别能力的第二轮评论家。我们在各种数据集上进行了实验,证明所提出的 ICM 可以提高各种闭源和开源模型的测试时性能,并且随着数据的回收,性能可以逐渐提高。代码和数据集将公开发布。

GAIA:用于训练GUI测试时扩展评论家模型的数据飞轮系统
图2:GAIA 的数据飞轮数据整理流水线。利用 GUI 智能体的交互构建样本数据集。通过将动作与 ground truth 动作进行比较来标注正负标签,以训练动作正确性判别模型。在 critic 模型引导 GUI 智能体之后,进一步扩充数据集,推动数据飞轮覆盖更多动作分布,从而促进模型性能的迭代提升。