论文
DOne:解耦结构和渲染以实现高保真设计到代码生成
DOne: Decoupling Structure and Rendering for High-Fidelity Design-to-Code Generation
摘要
虽然视觉语言模型 (VLM) 在设计到代码生成方面表现出了希望,但它们遇到了“整体瓶颈 - 无法协调高级结构层次结构与细粒度视觉细节,通常会导致布局扭曲或通用占位符。为了弥补这一差距,我们提出了 DOne,一个端到端框架,它将结构理解与元素渲染分离。DOne 引入了 (1) 一个学习的布局分割模块来分解复杂的设计,避免启发式裁剪的限制; (2) 专门的混合元素 检索器,用于处理 UI 组件的极端纵横比和密度;(3) 连接布局和代码的模式引导生成范例,我们引入了 HiFi2Code,这是一个比现有数据集具有更高布局复杂性的基准,表明 DOne 在高级视觉相似性方面优于现有方法(例如,在 GPT 中超过 10%)。分数)和细粒度元素对齐确认了 3 倍的生产力提升和更高的视觉保真度。