论文
风格重于实质:情感描述偏好评估的捷径审核
Style over Substance: A Shortcut Audit of Emotion-Description Preference Evaluation
摘要
对模型生成的情感描述的偏好正在成为多模态情感理解的标准评估指标,EmoPrefer 上的 MER2026 MER-Prefer 轨道就是例证。此类基准假设预测首选描述需要对视频进行扎实的跨模式理解。我们使用内容盲探查对 EmoPrefer 进行了系统的快捷审核。仅使用描述长度和生成器身份,而不处理文本、视频或音频的简单逻辑回归,其性能与经过 LoRA 微调的 7B 文本和视听法官相当(EmoPrefer-V2 上的 WAF 分别为 65.8 与 66.8)。生成器身份可以从描述文本中恢复,准确度为 99.5%,每个候选对都会对比两个不同的生成器,并且人类偏好标签与 66% 的评估对上的折叠独占的每个生成器获胜率先验一致。当人类的标签与先验的标签发生冲突时,训练有素的评委仍然会在 63% 到 80% 的配对中遵循先验的风格。在消除冗长偏差的长度匹配子集上,测试的媒体配置没有产生统计上显着的改进,而 ODIN 启发的诊断使风格快捷方式解耦,使其内容头几乎没有机会。这些结果并不意味着人类偏好本质上是风格化的,或者描述不包含情感信息。相反,他们表明,无需根据视频验证任何描述即可达到当前分数。我们建议为未来的跨生成器评估采用源平衡配对、严格的长度控制、反刻板印象的切片报告和多注释者共识。代码可在 https://github.com/jiabingyang01/EmoPrefer-Audit 获取。