论文

$f$-轨迹平衡:用于使用 Off- 和 同策略 数据调整 GFlowNet、生成模型和 LLM 的损失系列

$f$-Trajectory Balance: A Loss Family for Tuning GFlowNets, Generative Models, and LLMs with Off- and On-Policy Data

模型训练预训练

摘要

GFlowNet 与变分推断中,目标和模型对数概率的均方误差已被证明是训练生成模型的有效低方差代理损失:同策略评估时梯度对应 KL 散度,离策略下仍是具有相同全局最优解的有效损失。论文将这一构造推广到整个 f-散度族,得到同策略梯度对应各 f-散度、离策略仍保留全局最优解的损失族。研究证明,对目标和模型对数概率的平移不变损失,与 f-散度之间存在由同策略梯度建立的一一对应。利用此等价关系,可以设计更覆盖多个模式等具有相应散度性质、又能使用离策略数据的代理损失。论文在经典合成任务、分子发现 SynFlowNet 和异步大语言模型微调中应用这些目标,结果显示其在多类生成模型、同策略与离策略条件下保留预测性质。