论文

StepX-Edge:通过架构、训练与部署协同设计构建端侧UI视觉语言模型

StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design

模型优化端侧模型

摘要

在终端设备部署具有完整UI理解能力的视觉语言模型,长期面临准确性与效率冲突:OCR、屏幕理解、视觉问答和元素定位有精度要求,移动芯片则有严格的计算、内存与功耗预算。现有工作常在两者间取舍,或只做仿真而缺乏真机验证。本文提出0.9B参数端侧UI模型StepX-Edge,从架构、训练和部署三个层次协同设计。架构上,面向UI的分层视觉编码ULVE和渐进维度投影连接器PDP适应屏幕极端宽高比与细粒度感知,全程标准全注意力保证兼容主流移动NPU算子。训练上,五阶段StepX-Curriculum利用UI子任务相互促进的现象,使四种能力在有限参数预算内协同成长。部署上,按模块差异化设计的PTQ到QAT两阶段量化,将量化后的准确率损失控制在1%以内。StepX-Edge在不超过1B参数模型中取得最强综合UI理解表现,ScreenQA为88.76 F1,中文OCRBench v2为57.25,均超过所比较的2B–2.3B基线;RefCOCO为92.0%,OCRBench v1为831,以更少参数达到1.3B–2.3B通用VLM的水平。W4A16+KV8量化后,模型在骁龙8 Gen5设备上稳定运行,首词元时间约0.84秒,解码98词元/秒,峰值内存1.4GB。研究计划开放训练数据、完整训练方法和量化部署流程。