论文

UIPress:将光学词元压缩引入 UI 到代码生成

UIPress: Bringing Optical Token Compression to UI-to-Code Generation

模型推理推理加速

摘要

UI 到代码的生成需要视觉语言模型 (VLM) 从单个屏幕截图生成数千个结构化 HTML/CSS 标记,这使得视觉标记效率变得至关重要。现有的压缩方法要么使用与任务无关的启发式在推理时选择标记,要么将低注意力特征归零,而不实际缩短序列——既不能真正减少预填充延迟,也不能适应 UI 屏幕截图的不均匀信息密度。与此同时,光学(编码器端学习)压缩在文档 OCR 方面显示出强大的效果,但之前没有任何工作将该范例应用于 UI 到代码的生成。我们提出了 UIPress,这是一种插入到冻结 ViT 编码器和 Qwen3-VL-8B 的 LLM 解码器之间的轻量级学习压缩模块。 UIPress 结合了深度可分离卷积、元素引导空间重新加权和 Transformer 细化,将 ${\sim}$6{,}700 个视觉标记压缩到 256 个固定预算。再加上解码器上的低秩适应 (LoRA) 来弥补表示差距,整个系统仅添加 ${\sim}$21.7M 可训练参数(8B 基础的 0.26\%)模型)。在相同基础模型与 Design2Code 上的四个基线的公平比较下,256 个词元的 UIPress 获得了 0.8127 的 CLIP 分数,比未压缩基线高出 7.5\%,比最强推理时间方法高出 +4.6\%,同时提供 9.1$\times$ 的首次词元时间加速。据我们所知,UIPress 是第一个用于 UI 到代码任务的编码器端学习压缩方法。