论文

FED-Bench:面部表情编辑解开评估的跨粒度基准

FED-Bench: A Cross-Granular Benchmark for Disentangled Evaluation of Facial Expression Editing

模型评测基准与评测资源

摘要

面部表情图像编辑需要细粒度的控制,以严格保留人类身份和背景,同时精确操纵表情。然而,现有的编辑基准主要关注一般场景,缺乏高质量的面部图像和相应的编辑指令。此外,当前的评估指标在此任务中表现出系统性偏差,通常倾向于懒惰编辑或过度拟合编辑。为了弥补这些差距,我们提出了 FED-Bench,这是一个具有严格测试和准确评估套件的综合基准。首先,我们通过级联且可扩展的管道仔细构建了 747 个三元组的基准,每个三元组包含原始图像、编辑指令和 真值 图像,以进行精确评估。其次,我们引入了 FED-Score,一种跨粒度评估协议,它将评估分为三个维度:用于验证指令遵循的对齐、用于测试图像质量和身份保存的保真度、以及用于量化表达变化幅度的相对表达增益,有效缓解上述评估偏差。第三,我们对 18 个图像编辑模型进行了基准测试,揭示了当前的方法很难同时实现高保真度和准确的表达操作,而细粒度指令跟踪被认为是主要瓶颈。最后,利用引入的基准引擎的可扩展特性,我们提供了 20k+ 的野外面部训练集,并通过 微调 基线模型证明了其有效性,该模型实现了显着的性能提升。我们的基准测试和相关代码将很快公开开放。