论文

超越单一法官:用于生成 UI 评估的基于证据、社会加权的角色小组

Beyond a Single Judge: The Evidence-Grounded, Social-Weighted Persona Panel for Generative UI Evaluation

模型评测评测方法与指标

摘要

生成式 UI (GenUI) 让 大语言模型 直接从自然语言指令合成完整的可渲染界面,但评估它们生成的质量仍然是一个悬而未决的问题。人工评估成本高昂且评估者各不相同,而 LLM 作为法官是可扩展的,但仅反映单个隐式观点,无法捕获不同群体的真实用户实际上如何感知同一界面。我们提出了基于证据的、社会加权的角色面板(ESPP),这是一种三阶段的 GenUI 评估方法,其中一组心理多样化、基于证据的角色独立地对屏幕截图进行评分,在特征衍生的、语义门控的有限置信机制下交换意见,并通过德尔菲启发的社会权重聚合成单个判断。 ESPP 比天真的单遍判断更紧密地跟踪人类判断,将 Pearson $r$ 从 $0.716$ 提高到 $0.922$,而即时集成控制仅弥补了这一差距的约三分之一,将真实的角色和证据基础隔离为改进的主要来源。除了这种保真度增益之外,保留每个小组成员的个人评分进一步表明,用户子群体对整体模型排名达成一致,但在特定评分维度上却存在巨大分歧,单个同质评委可以系统地消除这种结构性分歧。代码可在 https://github.com/Wuzheng02/ESPP 获取。