论文

多模态LLM的移动用户体验推理:任务、基准与方法

Reasoning for Mobile User Experience with Multimodal LLMs: Task, Benchmark, and Approach

模型训练强化学习

摘要

以可用性、感知一致性和功能清晰度为中心的用户体验 (UX) 是现实世界用户界面 (UI) 的基础。多模态大语言模型(MLLM)在用户界面领域的应用正在迅速发展,例如视觉元素基础、图形用户界面(GUI)代理和设计到代码生成。然而,基于 UI 屏幕截图评估 UX 的研究工作仍不成熟。为了解决这个问题,我们提出了 UXBench,这是一种新颖的多模态基准测试,由 2,000 个 VQA 数据样本组成,旨在评估 MLLM 执行基于 UI 的推理的能力。 UXBench 包括基于真实 UI 屏幕截图的 8 项任务,这些任务需要对布局关系、视觉层次结构和内容一致性方面的 UX 问题进行细粒度诊断。我们对主流 MLLM 的广泛评估表明,它们基于 UI 的推理能力仍然受到根本限制。结果强调需要在这一领域取得进一步进展。为了弥补这一差距,我们提出了 UI-UX,这是一种基于 Qwen3-VL-4B-Thinking 基础模型的 MLLM,并通过强化学习进行了增强,具有两项关键创新:在推理过程中动态平衡感知理解和逻辑推理的奖励路由机制,以及抑制冗余或不足的推理步骤的不对称过渡奖励。实验表明,UI-UX 在 UXBench 上实现了最先进的 (SOTA) 性能,准确度达到 0.7963,超过了 Claude-4.5-Sonnet 的 0.6550,同时在不同的 UI 任务中表现出强大的泛化能力,并保持较低的推理延迟。

多模态LLM的移动用户体验推理:任务、基准与方法:论文配图
图 1:涵盖效率、可信度和可用性维度的 UXBench 示例。每种情况都需要视觉语义推理来检测用户体验问题(例如,重叠模态、欺骗性内容、缺失控件)。红色边界框表示用于定量评估的真实缺陷区域。任务涉及推断像素级感知之外的体验结果。