论文
GAIA:用于训练GUI测试时扩展评论家模型的数据飞轮系统
GAIA: A Data Flywheel System for Training GUI Test-Time Scaling Critic Models
摘要
虽然大型视觉语言模型 (LVLM) 在解析文本指令、解释屏幕内容和执行任务方面具有显着先进的 GUI 代理能力,但仍然存在一个关键挑战:代理操作的不可逆性,其中单个错误操作可能会引发灾难性偏差。为了解决这个问题,我们提出了 GUI Action Critic 的数据飞轮系统(GAIA),这是一个训练框架,使模型能够具有迭代批评家功能,用于提高基本 GUI 代理性能的测试时间缩放(TTS)。具体来说,我们首先使用基本代理的积极和消极行动示例来训练直观批评模型(ICM)。该批评家评估智能体预期行动的直接正确性,从而选择具有更高成功概率的操作。然后,初始批评者指导代理行动以收集精炼的正/负样本,启动自我改进循环。然后,增强的数据会训练具有增强辨别能力的第二轮评论家。我们在各种数据集上进行了实验,证明所提出的 ICM 可以提高各种闭源和开源模型的测试时性能,并且随着数据的回收,性能可以逐渐提高。代码和数据集将公开发布。
