论文

效用感知数据定价:LLM 的 词元级 质量和经验训练增益

Utility-Aware Data Pricing: Token-Level Quality and Empirical Training Gain for LLMs

AI 基础设施数据基础设施

摘要

传统的“行计数 $\times$ 质量系数”方法无法捕获 大语言模型 (LLM) 功能的数据的非线性效用。我们提出了一个效用感知数据评估框架,从静态会计转向基于效用的定价。该框架结合了 词元级 信息密度和数据质量、通过影响函数、代理模型和 Data Shapley 值估计的经验训练贡献,以及基于哈希承诺、Merkle 树和防篡改训练账本的加密机制。初步评估包括烟雾规模多领域研究和综合重复测试。结果表明,基于代理的经验收益与代理定义的已实现效用实现了强烈的排名一致性,并且在测试设置中大大优于行计数和词元计数基线,而原型提供了对估值管道及其对基于重复的操纵的敏感性的受控健全性检查。