论文

重标注图文监督分布的匹配预算审计框架

A Matched-Budget Audit Framework for Recaptioned Image-Text Supervision Distributions

模型评测评测方法与指标

摘要

重标注图文语料已成为文生图(T2I)训练的常见做法:视觉语言模型(VLM)描述生成器以详细描述替换稀疏的替代文本。重标注语料是一种监督分布,由有记录的描述生成策略(π)、描述生成器(V_c)和源语料(C)共同形成。与长度相关的代理指标会遗漏描述文本语域带来的伪迹,下游T2I基准又将语料与训练选择纠缠在一起,因此很难在语料规模上审计这种分布。我们为重标注监督分布D_{π,V_c,C}提出可复用的匹配预算审计框架:在B=64的固定文本预算下,报告涵盖提示侧覆盖度、图像条件下的忠实度与描述文本表层质量的五轴剖面,以声称的可控基本单元(CBU)作为统一的声明单位。我们在五个公开源语料上的七组配对比较中应用该框架。在四组跨语料配对中,无论采用Qwen还是Gemma裁判,发布的描述文本每条所支持的CBU均增加3.39至6.36;在CC12M上,该框架还揭示了篇幅长与信息密集之间的权衡边界,且在两个裁判和四档预算下保持一致。我们发布经审计的多源重标注语料(约490M规模)及配套审计材料。