论文
TRACE-Bench:分解和诊断多参考图像生成
TRACE-Bench: Decomposing and Diagnosing Multi-Reference Image Generation
摘要
尽管最近在用于多参考图像生成的统一多模态模型方面取得了进展,但现有的基准仍然围绕预定义的任务类型(例如“主题构成”)进行组织,这不适合这种组合设置,并导致覆盖范围分散、复杂性不受控制和诊断价值很小。认识到不同的多参考任务共享一组通用的原子操作,我们采用面向能力的视角,并形式化了四个操作符:Anchor ($f$)、Disentangle ($g$)、Apply ($\oplus$) 和 Compose ($C$)。然后,任何多引用提示都可以表示为这些运算符的组合公式,其结构复杂性通过运算符槽的数量来量化。在此基础上,我们构建了 TRACE-Bench,其中包含约 1,600 个跨槽数 1--8 的评估案例,由 631 个公式模板和约 4,000 个涵盖不同艺术风格和现实世界主题的参考图像构建而成。该公式结构直接驱动用于每个功能评分的操作员对齐评估协议和用于递归故障定位的诊断树分析。评估 9 个领先模型揭示了整体评分中看不见的见解:主要瓶颈在于解开 ($g$) 和属性绑定 ($\oplus$),而不是场景级合成 ($C$),即使是最好的模型在属性保真度上的得分也只有 0.74。项目页面:https://amuseum-whr.github.io/TraceBench