论文
可扩展的问题中心文生图评估:可靠排序、细粒度诊断与成本感知路由
Scalable Question-Centric Text-to-Image Evaluation: Reliable Ranking, Fine-Grained Diagnosis, and Cost-Aware Routing
摘要
现代文生图(T2I)模型常常总分相近但各有所长,使实际选型困难。细粒度基准将提示分解为问题,却往往又把问题归并回提示分数和固定类别,削弱了归因能力并忽略复杂度。相关需求也被分别打分或合成一个总分,掩盖了基础性失败与组合性失败的区别。我们提出QC-T2I-Bench,一个问题中心的框架,将开放提示转换为可归因的原子问题,并用Davidsonian场景图(DSG)组织其依赖关系。我们使用层级约束的问题聚合:在某前置问题失败后排除其下游问题,并防止简单与复杂提示获得相同的总权重。随后我们利用DSG结构测量提示内的联合成功并跨提示比较重复实体,将基础实现失败与附加要求下的失败区分开。我们在英文和中文提示上评估多个开源T2I模型。所得的问题级证据支持可靠排序与细粒度诊断:双能力组件的联合完成率为80.7%,而七项及以上能力组件降至37.2%。最后,我们将同一批记录复用于免训练路由;我们的成本感知路由器以少21.3%的GPU-s/MP匹配ERNIE 89.51分的估计值。
