论文

像素上的模式:测量多模式代码生成中的模式完成偏差

Pattern over Pixels: Measuring Pattern Completion Bias in Multimodal Code Generation

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 越来越多地用于将网页屏幕截图转换为前端代码,但重复的 UI 模式可能会使它们转向视觉上不正确但模式一致的输出。在这项工作中,我们在客观的屏幕截图到代码填空任务中测试重复的网页模式如何损害 MLLM 的准确性。我们引入了视觉模式完成偏差的第一个基准,其中重复 UI 模式中的一个本地化元素受到干扰,并且模型必须从屏幕截图和 HTML 上下文中恢复屏蔽的宽度或字体大小值。从 Design2Code 数据集精选的 30 个网页开始,我们构建了 1,440 个经过评估的屏幕截图,涵盖标准和噪声覆盖条件下的结构卡片和文本样式模式。我们评估了五个前沿 MLLM,发现它们都强烈偏向重复基线。卡片宽度扰动的平均偏差率达到 69.78%,文本字体大小扰动的平均偏差率达到 80.22%,而平均准确率分别仅为 21.17% 和 7.89%。 Codex-5.3 表现最好,但仍然从卡片上的 68.61% 准确率下降到文本上的 13.89%,而 Flash-3.0 在文本上的偏差达到 96.11%。噪声、更细微的扰动和边界位置进一步增加了偏差率。推理分析进一步表明,更大的推理努力与更低的偏差相关,但定性证据表明,模型可以识别异常元素,并且仍然用模式一致的答案覆盖它。我们的结果确定了多模式代码生成中的具体故障模式,并表明其严重性与视觉显着性密切相关