论文

心中公平,行中亦公平?UMLLM理解与生成的同步基准

Fair in Mind, Fair in Action? A Synchronous Benchmark for Understanding and Generation in UMLLMs

模型评测基准与评测资源

摘要

随着人工智能(AI)在各领域部署日益广泛,确保公平性已成为核心挑战。然而,该领域面临“巴别塔”困境:公平性指标众多,但其底层哲学假设常常相互冲突,阻碍统一范式——在统一多模态大语言模型(UMLLM)中尤为如此,因为偏见会在任务间系统性传播。为此,我们提出IRIS基准,据我们所知,它是首个同步评估UMLLM理解与生成任务公平性的基准。借助我们的人口属性分类器ARES和四个支撑性大规模数据集,该基准旨在把任意指标规范化并聚合成高维“公平性空间”,整合跨理想公平(Ideal Fairness)、现实保真(Real-world Fidelity)与偏见惯性及可控性(Bias Inertia & Steerability)三个维度的60个细粒度指标(IRIS)。通过该基准,我们对领先UMLLM的评估揭示了“生成鸿沟”等系统性现象、“人格分裂”等个体不一致现象以及“反刻板印象奖励”,同时提供诊断以指导其公平性能力优化。凭借新颖且可扩展的框架,IRIS基准能够整合不断演化的公平性指标,最终助力化解“巴别塔”僵局。项目主页: https://iris-benchmark-web.vercel.app/

心中公平,行中亦公平?UMLLM理解与生成的同步基准
图1:IRIS 基准的概念性示意图。此图展示整体工作流程,从 (a) 被测试的模型开始(§ A.1.1)。评估由 (b) 我们专门的工具包实现,包括 ARES 分类器与四个数据集(§ 3.3)。(c) 计算原始、细粒度的公平性指标(§ 3.4),并 (d) 将其投影到高维的“公平性空间”(fairness space)中,其中与原点(The IRIS Fairness Singularity)的距离量化偏差(§ 3.5)。(e) 该空间由 IRIS 基准的三个核心维度(Ideal Fairness、Real-world Fidelity、Bias Inertia & Steerability)构成,并应用于两个任务(Generation、Understanding),产生六个可解释的评估扇区(§ 3.1)。(f) 最终输出包括定量分数与定性的“人格”(personality)画像,为模型的公平性特征提供整体诊断(§ 4、§ 5)。