论文

全角色:系统基准测试和改进全模式个性化

Omni-Persona: Systematic Benchmarking and Improving Omnimodal Personalization

模型评测基准与评测资源

摘要

虽然多模态 大语言模型 在文本、图像和音频方面取得了进展,但个性化研究仍然主要是视觉语言,联合涵盖文本、图像和音频的统一全模态基准仍然有限,并且缺乏方法论的严谨性来解释缺席的角色场景或系统的基础研究。我们推出 Omni-Persona,这是第一个全模式个性化的综合基准。我们将任务形式化为角色模态图上的跨模态路由,包含 4 个任务组和 18 个细粒度任务,涵盖约 750 个项目。为了严格诊断感知依据关联行为,我们提出了校准准确性(Cal),它联合评估正确的感知依据关联和适当的弃权,将缺席角色查询纳入统一的评估框架中。在我们的专门实验中,出现了三个诊断结果:(i)最近的开放权重模型显示出一致的音频与视觉基础差距,RLVR 通过密集的基于规则的监督部分缩小了这一差距; (ii) 回忆分数和参数量表是不完整的诊断,因为强回忆可以与缺席幻觉共存,并且较大的模型并不总是获得更高的 Cal,从而将校准暴露为单独的评估轴; (iii) SFT 受到 真值 注释的可扩展性的限制。在我们的奖励设计下,RLVR 提高了召回率,但没有校准弃权率,使 Cal 处于或低于基本模型。因此,Omni-Persona 可以作为一个诊断框架,揭示全模式个性化的陷阱,指导未来的 后训练 和奖励设计。