论文
MPIE-Bench:对解剖学上合理的多人交互编辑进行基准测试
MPIE-Bench: Benchmarking Anatomically Plausible Multi-Person Interaction Editing
摘要
文本到图像和个性化编辑模型现在可以轻松合成高保真单一主题图像。然而,将多个指定的人置于共同的接触动作中,例如拥抱、携带或擒抱,仍然会暴露出重大失败:融合的肢体、发明的四肢和相互渗透的身体。现有的评估在很大程度上忽视了这些解剖学和几何问题,并且 VLM 作为法官的检查表经常在交互上饱和,而错误对人类来说仍然是显而易见的。我们推出了 MPIE-Bench,这是一个包含 2,500 个样本的视频挖掘编辑三元组基准测试,涵盖 405 个场景、14 个交互类别和四种接触密度 (C0-C3)。我们还提出了 MPIE-Eval,其两个新轴从冻结的公共多人网格重建中对接触时间几何进行评分。解剖学询问是否每个类人质量都可以通过一组完整的重建身体来解释,而交互则询问这些身体之间的穿透距离和表面距离是否与指令要求的接触相匹配。在十个编辑器中,网格解剖在两个不同模型上的得分最高为 0.65,网格交互为 0.72,因此没有哪个编辑器在这两个方面都很强,而 VLM 检查列表对相同图像的评分高于 0.95。一项由五名评估者组成的研究证实,两个轴比零样本 VLM 法官更能追踪人类判断,并且在每个权重和阈值被消融的情况下排名仍然保持不变。