论文

离散词元空间中理解和指导数据集 蒸馏 的结构评估

Structural Assessment for Understanding and Guiding Dataset Distillation in Discrete Token Space

模型训练合成数据

摘要

数据集 蒸馏 (DD) 已被证明可以在保持准确性的同时降低训练成本。尽管前景光明,但使一个精炼数据集比另一个数据集更有效的因素仍然知之甚少。在这项工作中,我们通过离散视觉标记器的镜头来研究这个问题。尽管许多先前的 DD 工作强调匹配全局数据分布,但我们建议其有效性取决于捕获的语义概念以及它们的组成方式。离散视觉分词器提供了有限的词汇表,可以对此类组合结构进行直接统计分析。通过对 词元级 统计数据的定量分析,我们引入了结构评分来衡量词元构成的充分性。我们观察到,具有平衡词元组成的蒸馏数据集会产生更高的验证性能。另一方面,与原始数据的偏差并不一定会损害性能。我们进一步表明,离散标记空间中具有高结构得分的样本可以有效地指导基于扩散的 DD。我们的研究结果强调了词元组成在数据集有效性中的重要性,为 DD 中的分布相似性考虑因素提供了原则性补充。