论文
GRASP:用于可扩展预训练数据归因的几何感知残差对齐
GRASP: Geometry-aware Residual Alignment for Scalable Pretraining Data Attribution
摘要
可扩展的数据归因方法通常将独立的效用分数分配给各个训练示例。这种流行的附加假设从根本上无法捕获关键子集动态,包括数据冗余和互补覆盖。在这项工作中,我们将归因重新定义为子集级反事实效用预测,并引入了 GRASP(一种交互感知代理)。基于理论平滑度下界,GRASP 通过二次几何惩罚显式地模拟子集交互。为了在不依赖隐藏预言调整的情况下实现预训练规模的效率,我们将低维特征草图与严格有限的较低置信度边界选择协议结合起来。广泛的子集再训练评估表明 GRASP 明显优于现有的可扩展基线。它将反事实子集保真度的任务级排名相关性提高了一倍以上,同时将前期工件构建成本降低了近一个数量级。下游诊断进一步表明,这种评分机制转移到语言模型管理和跨域视觉选择,为优化大规模预训练语料库奠定了坚实的基础。