论文

高效数据合成的信息论标准

An Information-Theoretic Criterion for Efficient Data Synthesis

模型训练合成数据

摘要

合成数据对于 大语言模型 训练至关重要,但其有效性高度不一致。我们提供了这种不一致的信息论解释:只有当生成训练循环是信息开放的时,合成数据才能改进模型,即由外部信号(验证者、环境或规则)塑造,这些信号将任务相关信息注入模型当前的分布之外。当循环是信息封闭的(依赖于模型自身的输出而没有此类信号)时,数据处理不平等确保与任务相关的信息只能减少,从而使崩溃成为预测结果。在信息开放的管道中,效率和泛化都取决于监督的元级别:诸如二进制正确性之类的较粗糙信号将所有可接受的输出视为等效,因此它所教授的行为不依赖于任何特定领域或表面形式,并且可以自然地跨任务和领域泛化。这些观察结果得出了一个指导性论点:学习优先收敛到可用的信息效率最高的信号分量,当该分量是预期信号分量时,这会加速学习,但当虚假模式碰巧更简单时,会导致 奖励作弊。