论文

环境离散扩散:在正确的时间使用错误的数据进行数据高效学习

Ambient Discrete Diffusion: Using the Wrong Data at the Right Time for Data Efficient Learning

模型训练监督微调与指令调优合成数据

摘要

我们介绍 RefineMix,这是一个在严重数据稀缺(科学应用中的常见限制)下训练离散扩散模型的框架。 RefineMix 在选定的扩散时间使用分布外数据来提高泛化能力,而不会使采样分布产生偏差。尽管这种策略已经在连续扩散中进行了探索,但离散扩散提出了一个明显的挑战:与高斯噪声不同,掩蔽保留了幸存token中的域信息,限制了高噪声水平下相关数据的使用。然而,在低噪声水平下,域有效不相交的支持成为一种优势,允许模型从域内和分布外数据中学习,而不会使采样器产生偏差。我们将这些直觉形式化,并为所提出的方法提供理论分析。经过实验,在五个域转移设置中,RefineMix 匹配或优于域内微调和数据混合。对于蛋白质序列生成,仅使用 197 个域内示例进行微调,就几乎使生成的蛋白质比例增加了一倍 与标准微调相比,它同时新颖、可折叠且适合家庭使用。