论文

LLaDA-UI:将分块扩散引入视觉语言 GUI智能体

LLaDA-UI: Bringing Block-wise Diffusion to Vision-Language GUI Agents

模型架构新型架构

摘要

扩散大语言模型 (dLLM) 通过块并行、任意顺序生成实现高解码效率,使其对延迟敏感的应用程序具有吸引力。 GUI智能体代表了这种范例的自然测试平台,因为它们必须反复感知屏幕状态并实时发出结构化的、基于空间的动作。然而,dLLM 是否可以扩展到有能力的多模式 GUI智能体,同时保留其并行解码优势仍然是一个悬而未决的问题。我们推出了 LLaDA-UI,这是一种基于 MoE 的 16.7B 参数、分块扩散视觉语言 GUI智能体。 LLaDA-UI 遵循两阶段训练流程:通用多模态预训练将原始分辨率视觉编码器与 LLaDA2.0-mini-base 扩散语言主干对齐,然后在不同的移动、桌面、Web 和基础数据上进行 GUI智能体监督微调。在跨越多个平台的广泛采用的界面元素定位基准测试和导航基准测试中,LLaDA-UI 的性能显着优于 Qwen2.5-VL-7B,并且在报告的六个 GUI 基准测试中的四个上超过了 Qwen3-VL-8B。这些结果将分块扩散确立为多模式 GUI智能体的实用生成范例。