论文

通过强化学习学习检测违反 UI 原则的行为

Learning to Detect UI Principle Violations via Reinforcement Learning

模型评测评测方法与指标

摘要

小语言模型和 编码智能体 越来越多地生成 Web 前端代码,但它们的输出通常主要针对功能正确性进行评估。生成的界面可能会编译、渲染并通过单元测试,但仍然违反既定的界面质量原则,包括可访问性障碍、欺骗性设计模式、不良的视觉层次结构和过度的决策复杂性。现有的审计方法面临成本、覆盖范围和可扩展性之间的权衡:专家人工审核提供了丰富的判断,但速度缓慢且昂贵;前沿视觉语言模型提供了更广泛的推理能力,但大规模部署的成本仍然很高;基于规则的工具(例如 axe-core 和 Lighthouse)价格便宜,但主要捕获机械可检查的可访问性问题。我们研究轻量级视觉语言模型是否可以作为生成界面的有效批评者。我们统一了来自三个互补的 HCI 知识来源的 19 条界面质量原则:WCAG 2.2 可访问性标准、欺骗性设计分类法以及已建立的感知、认知和交互理论。为了训练这个批评者,我们通过将已知的违规行为综合注入到干净的、LLM 生成的 Tailwind 页面中,构建了一个由大约 10,000 个生成的网页组成的经过验证的数据集。对 4B 视觉语言模型的持续强化学习将 micro-F1 从 36\% 提高到 84\%,19 个原理中有 13 个超过 80\% F1。由此产生的批评者可以审核生成的接口,过滤低质量的接口训练数据,并为设计感知代码生成提供奖励信号。我们发布了数据生成方法和注入/验证提示,以支持可重复的评估和可扩展接口质量评估的未来工作。